{"as_of":"2026-08-19T12:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7db1cc6b3f7add85f894685e2be7c12eb903713fac561971c79f460284d0251","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:52:16.027375Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11887/citation-record","integrity":"/paper/2505.11887/integrity","json":"/paper/2505.11887/citation-record.json","paper":"/paper/2505.11887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.654988Z","title":null,"venue":null,"work_id":"dfccc0a3-513a-460e-9483-7d5fafe0ba3f","year":2006},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.826594Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:ad9a04380b7638901d9451cbe83573d49601988603468351e84c6f80dd46106a","observation_id":"fe99e6b2-9ad4-4833-9ce6-5a156b5afac0","resolution":{"observed_at":"2026-08-15T20:52:16.660025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-16T15:18:11.446102Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-08-15T20:52:15.832274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.832274Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:b1f768eebf984c80842aad94e3991b31b7fc562f5be183b16b694b1071a02b88","observation_id":"736cacf7-1b7a-4eea-961a-98d75003af34","resolution":{"observed_at":"2026-08-15T20:52:15.832274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11598","last_updated":"2023-05-19T11:20:37Z","snapshot_observed_at":"2026-08-16T15:31:44.346693Z","submitted_at":"2023-05-19T11:20:37Z","title":"Introspective Tips: Large Language Model for In-Context Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11598","snapshot_observed_at":"2026-08-15T20:52:15.839099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.839099Z"},"links":{"cited_paper":"/paper/2305.11598","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:7c0f922a2c732276a5b097d1857e23415cf6026b6f35caa7605baf1645e880ec","observation_id":"3ae1315f-b2e0-4ea2-be39-cdbecc09e727","resolution":{"observed_at":"2026-08-15T20:52:15.839099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.844477Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.844477Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:28528095ec261c9e8bc369f93861a17bf861b74137a6a7f532de09ded72a98a8","observation_id":"d3a4a363-d82e-462d-9b14-f15d2b378a85","resolution":{"observed_at":"2026-08-15T20:52:15.844477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T20:52:15.849900Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.849900Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:2095a6fe2fe2f9473f39968df1bd82d901fddbbfbd1c0ac194dcc8dde5392660","observation_id":"063b6d11-0eb9-4b03-9afa-a12882c2c04f","resolution":{"observed_at":"2026-08-15T20:52:15.849900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.855086Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\'e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.855086Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:0751c974f4ebb063f800536ed681d8abf607c05bc176646030d787294cef0285","observation_id":"8d7314dc-5800-4c7e-9114-d2d66514e84f","resolution":{"observed_at":"2026-08-15T20:52:15.855086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.860881Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.860881Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:f04803209e3a9f631d174802055297f7ad02b83ac2691fa680c7d9c804756d19","observation_id":"36d53d3c-ce5d-4da7-9ce9-5c06e55ddab4","resolution":{"observed_at":"2026-08-15T20:52:15.860881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-15T20:52:15.865639Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.865639Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:305ea4cf01aae9d1b8cea19347ab3d739aff678be7eabac2732f2de7e2ef520b","observation_id":"5ae0853d-ebca-4618-beea-738a08a39a98","resolution":{"observed_at":"2026-08-15T20:52:15.865639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04361","last_updated":"2017-03-13T12:48:15Z","snapshot_observed_at":"2026-08-14T21:12:09.255849Z","submitted_at":"2017-03-13T12:48:15Z","title":"Toward a Formal Model of Cognitive Synergy","version":1},"cited_work":{"arxiv_id":"1703.04361","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.04361","snapshot_observed_at":"2026-08-15T20:52:16.359179Z","title":"Toward a Formal Model of Cognitive Synergy","venue":"cs.AI","work_id":"1377960a-8742-41b2-bbb2-12c621628bcf","year":2017},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.871422Z"},"links":{"cited_paper":"/paper/1703.04361","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:f0056314f0c94d7d2d7c8fe020bd195c41089cdbde08895f595b683c6ca2d951","observation_id":"f0ff8caf-385a-48e6-b8e6-99532332d0a0","resolution":{"observed_at":"2026-08-15T20:52:16.366965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08247","last_updated":"2025-03-18T21:31:51Z","snapshot_observed_at":"2026-08-18T08:20:50.087566Z","submitted_at":"2023-04-14T11:28:08Z","title":"MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08247","snapshot_observed_at":"2026-08-15T20:52:15.876404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.876404Z"},"links":{"cited_paper":"/paper/2304.08247","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:869f8292c48824143576d39537b2df0aaffafa61751c8e5cb8451eb7b45a0695","observation_id":"bfa08233-90d0-4f6c-b2fe-e0a910ef035a","resolution":{"observed_at":"2026-08-15T20:52:15.876404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.881968Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.881968Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:e6a7fd8d1d1e79f339dfc072e20001767d5f7262ab357900ae461275b3a42f53","observation_id":"89f45ce1-1142-4618-b202-8b989b4a4413","resolution":{"observed_at":"2026-08-15T20:52:15.881968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.595322Z","title":null,"venue":null,"work_id":"84ddcf74-f592-4aca-b946-c65acc19d815","year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.886953Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:d722356d7ce8f03a08f93e0fa9355db0cedece5d4409a853881a52f788c4fb72","observation_id":"fcc36fad-f0dd-4f5d-92a2-66b04e719431","resolution":{"observed_at":"2026-08-15T20:52:16.599814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-15T20:52:15.891381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.891381Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:6c9d4cb8fd9d2c999e7bccf91a6ba3ed27bdb42c090e432ac61d5dbcc2c35411","observation_id":"75244dc7-19e0-4da3-833e-598a2453cda8","resolution":{"observed_at":"2026-08-15T20:52:15.891381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.895949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.895949Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:6dbeb76688e48376faf2e606f50bfb41ae7b5f6ee6b7b7de819b318617a89ec7","observation_id":"d0546bd6-e589-410c-8fa1-fd9973c40731","resolution":{"observed_at":"2026-08-15T20:52:15.895949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07103","last_updated":"2024-06-12T08:31:58Z","snapshot_observed_at":"2026-08-16T14:27:44.192442Z","submitted_at":"2024-01-13T15:59:09Z","title":"Leveraging Large Language Models for NLG Evaluation: Advances and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07103","snapshot_observed_at":"2026-08-15T20:52:15.900326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.900326Z"},"links":{"cited_paper":"/paper/2401.07103","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:4ec7c67ca293fcbdd886d4995fdf382b955e79db066a3f07a1d444682279e11a","observation_id":"60031fa8-d1b2-4d9e-ac79-746eb84c8c87","resolution":{"observed_at":"2026-08-15T20:52:15.900326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.904615Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.904615Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:90170b55d58ee9d9b440758a745bf72eff828e095fe96399c6ea55bb2f3e4acf","observation_id":"4ce9db86-1999-470d-8155-96053a3c25ec","resolution":{"observed_at":"2026-08-15T20:52:15.904615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.908759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.908759Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:2649ce59727b49a36ee6d26a85e969aa75b74d1e76d467b13b99fc12e12010e6","observation_id":"7cec2532-cd5a-4414-8135-6becd8038079","resolution":{"observed_at":"2026-08-15T20:52:15.908759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.556433Z","title":null,"venue":null,"work_id":"f2da0497-9c13-4f13-bfda-b48479c6944d","year":1999},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.913094Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:ac740251066aa2f9cce5a49d0ef9543bd17360452c2d316e09c881c161248bc7","observation_id":"85bb0d07-65c8-4179-8b85-d7dbabe780bd","resolution":{"observed_at":"2026-08-15T20:52:16.561310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.539290Z","title":null,"venue":null,"work_id":"80e9dec4-07ea-41cb-9bf7-01c61dbd0091","year":2024},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.917947Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:7e459dae4cd985ef16dfb0f48427e633f19f009a943a4050e43daeecd0a65415","observation_id":"99621ce5-1fcb-42a1-be4e-5ba4f055cfb8","resolution":{"observed_at":"2026-08-15T20:52:16.544356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13375","last_updated":"2023-04-12T16:48:39Z","snapshot_observed_at":"2026-08-17T08:49:52.717771Z","submitted_at":"2023-03-20T16:18:38Z","title":"Capabilities of GPT-4 on Medical Challenge Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13375","snapshot_observed_at":"2026-08-15T20:52:15.923080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.923080Z"},"links":{"cited_paper":"/paper/2303.13375","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:58419b0a08a448e153d7fdd32d22db72e0aca9ed9b21948b2ec46a147fd63ca5","observation_id":"27a5002f-8dd5-471b-99bd-417cee32d824","resolution":{"observed_at":"2026-08-15T20:52:15.923080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.928985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.928985Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:45574b682d9718d2accd08ac3a76a17a13dba39bfb1124abb248bd9b43d5bcd5","observation_id":"1bf04891-3e13-4240-be05-c998aae1a61a","resolution":{"observed_at":"2026-08-15T20:52:15.928985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.509578Z","title":null,"venue":null,"work_id":"63bc5676-0588-4c54-a4a6-98c176c2ca74","year":2002},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.934256Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:f7e8b9a7ff168105a43222370ed343edd2e9e252e30991226c0c4a7a948d0139","observation_id":"ec796b18-65fd-4cc5-a77a-8f7563445835","resolution":{"observed_at":"2026-08-15T20:52:16.515007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-15T20:52:15.939911Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.939911Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:4dbe246160c5304a4fa57097f2f74fbc1b8b22cea1b5f06f4a8fb310d251f9b0","observation_id":"fd885281-6373-4f5d-9fe6-2571e34e8ebb","resolution":{"observed_at":"2026-08-15T20:52:15.939911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:15.945505Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.945505Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:731735754d73cf3d339ee4414a3cb7a510c81c0936b7a63f6e48131d3146b2ad","observation_id":"26999ed6-402f-43ee-8b98-d0ecba9448f0","resolution":{"observed_at":"2026-08-15T20:52:15.945505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.479860Z","title":null,"venue":null,"work_id":"9a8e9794-6621-4ed5-8a69-d82d1c989eb2","year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.950355Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:9b5f0d78c2534fd08535234d9e8352f5971d86e7738cc969f2a972dd7074ed5f","observation_id":"ec019236-0aeb-45d0-9fbb-c2e864adf274","resolution":{"observed_at":"2026-08-15T20:52:16.485216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-16T14:30:19.311365Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-15T20:52:15.955259Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.955259Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:3b75db06a654c492b08b142821b54684a5821a1042cee6affd693da990c25d50","observation_id":"d52e11df-71b6-4140-b3e9-f58d670e1e82","resolution":{"observed_at":"2026-08-15T20:52:15.955259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14334","last_updated":"2023-07-26T17:52:22Z","snapshot_observed_at":"2026-08-16T15:13:02.877614Z","submitted_at":"2023-07-26T17:52:22Z","title":"Towards Generalist Biomedical AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14334","snapshot_observed_at":"2026-08-15T20:52:15.960802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.960802Z"},"links":{"cited_paper":"/paper/2307.14334","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:0d740ed11bf68bf9b82d29567e15e6c5e6d9e4fabbf5b89489d3c8305c4cc9f9","observation_id":"c502c932-4b3f-4e1b-8c9b-c0d10e69fae9","resolution":{"observed_at":"2026-08-15T20:52:15.960802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-16T15:50:04.573553Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-15T20:52:15.966499Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.966499Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:445f589c3d3c5036d02b7474d7bc82e4a24e32b4ddbc53a0d55bc4c731c6d62b","observation_id":"62e19b43-25cc-4929-bff4-926201a354b8","resolution":{"observed_at":"2026-08-15T20:52:15.966499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:52:15.971613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.971613Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:59d79cb9e15b38c84cd3182d50304cda97bad02d8d76d4aa197a741f4545e426","observation_id":"31e83056-c601-4f4b-9e4c-0b4f6bc2ea90","resolution":{"observed_at":"2026-08-15T20:52:15.971613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05342","last_updated":"2024-03-20T20:37:17Z","snapshot_observed_at":"2026-08-16T15:09:29.067291Z","submitted_at":"2023-08-10T05:10:17Z","title":"Metacognitive Prompting Improves Understanding in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05342","snapshot_observed_at":"2026-08-15T20:52:15.976781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.976781Z"},"links":{"cited_paper":"/paper/2308.05342","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:0fe1c7612f2d8c0ccb8950f548c566ae8fec02eda358359a65f351537e2bec71","observation_id":"0ed5c82e-5a2f-4981-85b3-0e38ec60b5f2","resolution":{"observed_at":"2026-08-15T20:52:15.976781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14454","last_updated":"2023-08-25T14:08:38Z","snapshot_observed_at":"2026-08-16T15:37:09.057272Z","submitted_at":"2023-04-27T18:29:05Z","title":"PMC-LLaMA: Towards Building Open-source Language Models for Medicine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14454","snapshot_observed_at":"2026-08-15T20:52:15.981975Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.981975Z"},"links":{"cited_paper":"/paper/2304.14454","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:941359b9d427651a8e7127d67c0b436d0eb68d0a01455b78dfab2fb10cdf2ced","observation_id":"d6a6421d-a7c4-4106-9d8f-69d28feb8bf5","resolution":{"observed_at":"2026-08-15T20:52:15.981975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01097","last_updated":"2023-04-17T17:06:29Z","snapshot_observed_at":"2026-08-16T15:43:09.845753Z","submitted_at":"2023-04-03T15:57:51Z","title":"DoctorGLM: Fine-tuning your Chinese Doctor is not a Herculean Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01097","snapshot_observed_at":"2026-08-15T20:52:15.986548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.986548Z"},"links":{"cited_paper":"/paper/2304.01097","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:58d48a40117bfe52fd0e64c8dce0354c18c5984444bc70f816c4a0eb7a84092a","observation_id":"44085475-2b97-4358-981d-f60b41e82d89","resolution":{"observed_at":"2026-08-15T20:52:15.986548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01196","last_updated":"2023-12-02T21:05:22Z","snapshot_observed_at":"2026-08-16T15:43:07.047307Z","submitted_at":"2023-04-03T17:59:09Z","title":"Baize: An Open-Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01196","snapshot_observed_at":"2026-08-15T20:52:15.993415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.993415Z"},"links":{"cited_paper":"/paper/2304.01196","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:8ac3553eab6b615604024fa6f9573fd5cdcbb64b3dd0faed98a6ef51e9d82bb9","observation_id":"6f264726-f235-421e-a510-d611fd71af91","resolution":{"observed_at":"2026-08-15T20:52:15.993415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07340","last_updated":"2023-05-12T09:37:13Z","snapshot_observed_at":"2026-08-16T15:33:37.967255Z","submitted_at":"2023-05-12T09:37:13Z","title":"MedGPTEval: A Dataset and Benchmark to Evaluate Responses of Large Language Models in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07340","snapshot_observed_at":"2026-08-15T20:52:15.999735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.999735Z"},"links":{"cited_paper":"/paper/2305.07340","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:04993bb0dfa5887095216aba695afd2f4c99d0f69bb8bffa408a0a8719a21081","observation_id":"7bcb0c7c-1f6a-42b9-8737-f99deb595d32","resolution":{"observed_at":"2026-08-15T20:52:15.999735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.006632Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.006632Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:04a3dca88da6ba42ff1d68e2ea44f32a7e2f3f34fbf5a382bb2bcd0fbc14cdb6","observation_id":"9a442ca2-7af7-4e24-b452-500945c5925b","resolution":{"observed_at":"2026-08-15T20:52:16.006632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T20:52:16.011526Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.011526Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:104c9fde3b1e866e7ba4fcc452fb0d65afac99fe6661cc6a633d0912e3544ec8","observation_id":"f3741cb3-ea52-4b82-ac10-7fd2b015fbae","resolution":{"observed_at":"2026-08-15T20:52:16.011526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T20:52:16.016392Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.016392Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:27dde25473f4eb84d25b5e7787bb09dc97f0dcdaa4bc04db5418a2deee09f323","observation_id":"a460ea7c-0bef-4bbc-860a-30cb27ad795b","resolution":{"observed_at":"2026-08-15T20:52:16.016392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.021831Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.021831Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:32dba85eeeb8a3bff8e30c8dbeb82e2cc338c6deefa449a88a399dbc7bfa9113","observation_id":"f9f921f0-261d-437f-a04e-24c482c895c0","resolution":{"observed_at":"2026-08-15T20:52:16.021831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:16.027375Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:16.027375Z"},"links":{"citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:7db0519dd5334547128be4dce831575ab3fb7910150e89e7e7933dcfba4511da","observation_id":"1da77e8c-2915-4da3-9140-e64a5116ad75","resolution":{"observed_at":"2026-08-15T20:52:16.027375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.11887."}