{"as_of":"2026-08-07T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:deae76bf8e72ba1b2608347f8d3a248cfd4ff53b98f3a5280eed7da22b0fafb9","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:42:53.123407Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T17:02:30.696295Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:19:34.994254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"cited_work":{"arxiv_id":"2505.24040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24040","snapshot_observed_at":"2026-07-04T04:19:34.994254Z","title":"Medpair: Measuring physicians and ai relevance alignment in medical question answering","venue":null,"work_id":"0581f534-69c6-4b0b-a662-373d3e2bd50e","year":2025},"citing_paper":{"arxiv_id":"2506.23040","last_updated":"2026-04-28T19:11:23Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T00:23:06Z","title":"Treatment, evidence, imitation, and chat","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T08:21:05.698812Z"},"links":{"cited_paper":"/paper/2505.24040","citing_paper":"/paper/2506.23040"},"observation_digest":"sha256:c499eb6f1becc25b20913a3b515af145ea94ac68d95fec5c23d4077760faf643","observation_id":"c2b5d90d-a592-4cfb-a612-656ac73f0cb7","resolution":{"observed_at":"2026-05-19T08:22:10.892747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"cited_work":{"arxiv_id":"2505.24040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24040","snapshot_observed_at":"2026-07-04T04:19:34.994254Z","title":"Medpair: Measuring physicians and ai relevance alignment in medical question answering","venue":null,"work_id":"0581f534-69c6-4b0b-a662-373d3e2bd50e","year":2025},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-02T07:12:00.817422Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2505.24040","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:e91736a178f4a68f87151e5e4a5d0472b9db21db52ac9ef6336b8cf11a57bac1","observation_id":"754b740e-9581-46b2-9fe4-fbb513d5b8b2","resolution":{"observed_at":"2026-05-11T19:31:08.604352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"cited_work":{"arxiv_id":"2505.24040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24040","snapshot_observed_at":"2026-07-04T04:19:34.994254Z","title":"Medpair: Measuring physicians and ai relevance alignment in medical question answering","venue":null,"work_id":"0581f534-69c6-4b0b-a662-373d3e2bd50e","year":2025},"citing_paper":{"arxiv_id":"2606.20363","last_updated":"2026-06-18T15:25:42Z","snapshot_observed_at":"2026-07-06T23:55:29.991442Z","submitted_at":"2026-06-18T15:25:42Z","title":"Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:02:30.696295Z"},"links":{"cited_paper":"/paper/2505.24040","citing_paper":"/paper/2606.20363"},"observation_digest":"sha256:0094b0625a1d4dd76259f78804607301481e6482f26bf67ff01e011ed86ee9c5","observation_id":"3911e0e9-f2f5-4471-a71b-d8a61893a70b","resolution":{"observed_at":"2026-07-04T04:19:34.996501Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24040/citation-record","integrity":"/paper/2505.24040/integrity","json":"/paper/2505.24040/citation-record.json","paper":"/paper/2505.24040"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.05600","last_updated":"2024-05-09T07:39:19Z","snapshot_observed_at":"2026-07-06T18:11:57.100591Z","submitted_at":"2024-05-09T07:39:19Z","title":"Can We Use Large Language Models to Fill Relevance Judgment Holes?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05600","snapshot_observed_at":"2026-08-07T12:42:47.373137Z","title":"Can We Use Large Language Models to Fill Relevance Judgment Holes?, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.373137Z"},"links":{"cited_paper":"/paper/2405.05600","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:d530d099841afc5a3d1b561f08e2ab1a88b5e073446d201f54685082e8e3413c","observation_id":"896e37bd-4420-440b-b58a-955634184988","resolution":{"observed_at":"2026-08-07T12:42:47.373137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:01.448557Z","title":"Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answer- ing.Transactions of the Association for Computational Linguistics, 12:681–699, 2024","venue":null,"work_id":"01fbae8f-d1df-4931-a003-b59523fef0c4","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.454079Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:71e5005a0d386878e9c1c6d3acb4f18288c7b1b449adea0e9910797cb5a1f8c4","observation_id":"4ba8765b-c6d5-4427-a016-69206bdb2628","resolution":{"observed_at":"2026-08-07T12:43:01.540335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01282","last_updated":"2025-07-30T02:25:44Z","snapshot_observed_at":"2026-08-07T16:16:03.654497Z","submitted_at":"2025-04-02T01:19:37Z","title":"Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01282","snapshot_observed_at":"2026-08-07T12:42:47.520925Z","title":"Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.520925Z"},"links":{"cited_paper":"/paper/2504.01282","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:7417d036ea495d9f41a83fc7d6f55b5954e059edfa82d9654b1381516f485345","observation_id":"edb08fed-c0a0-4444-a431-21e84c342fa6","resolution":{"observed_at":"2026-08-07T12:42:47.520925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:01.325764Z","title":"LLM Stability: A detailed analysis with some surprises.CoRR, January 2024","venue":null,"work_id":"f64742c6-5497-4122-a938-d53f0121d7b3","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.573430Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:d7036067df94aecbabc70023863ccdb7b58069b734135d0b6d26d8f95b89e1a4","observation_id":"dcc6e987-7e02-414b-b536-0475620f76c7","resolution":{"observed_at":"2026-08-07T12:43:01.374152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:01.110672Z","title":"Does the Whole Exceed its Parts? The Effect of AI Explanations on Complementary Team Performance","venue":null,"work_id":"0d97ccab-20c0-4c96-bfed-4b5356e07311","year":2021},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.618744Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:487f2d76637c3ac641d5c6edcd430a4e01fca67be5b56415c3e7c969b1114d17","observation_id":"a7088955-a11b-40fc-b0f9-5cbba743a2c1","resolution":{"observed_at":"2026-08-07T12:43:01.204581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.945223Z","title":"LLMs with Chain-of-Thought Are Non-Causal Reasoners.CoRR, January 2024","venue":null,"work_id":"684bb1d0-d12c-413d-80ad-d0d2c66dea01","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.677371Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:f65b09fdfdb1d4749534dc39a5d26a1c7ce8ab8d661ec301d15cedb27ac74cd3","observation_id":"5c5091e5-d6b4-4eb1-9bbc-097a5aa693bf","resolution":{"observed_at":"2026-08-07T12:43:01.026316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.807831Z","title":null,"venue":null,"work_id":"28b4c381-25b2-49d3-a4c9-4195bce7244a","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.733566Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:cc10055988d77a7c55d9975c1f20d84d1b8d39596ee0a1d56ad7821d71bbbdad","observation_id":"c962acac-362b-44e9-a52c-ab7da4651209","resolution":{"observed_at":"2026-08-07T12:43:00.853146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.731422Z","title":null,"venue":null,"work_id":"c9251660-f90b-45f6-8853-7dcf4d86e302","year":2021},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.825672Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:f796a300eae582caaa0d9063c12a125f329923c98199317ebdf650b0ae2ac8e6","observation_id":"2dab7938-f13c-4679-b569-71c0f1da83aa","resolution":{"observed_at":"2026-08-07T12:43:00.766014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.588484Z","title":"Clinical Reasoning of a Generative Artificial Intelligence Model Compared With Physicians.JAMA Internal Medicine, 184(5):581–583, May 2024","venue":null,"work_id":"b6aa3363-ae1f-4cd5-b097-3db30a4b6016","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.859493Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9fd5aa2c9d4896fa938a306820e241cb33771cbb2a29074987ff4b386b1645d3","observation_id":"605ec00f-5428-4b24-8de1-0fb383a0b60b","resolution":{"observed_at":"2026-08-07T12:43:00.641860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.470401Z","title":"Barnhill, Mar Llamas-Velasco, Gabriela Poch, Sören Korsing, Wiebke Sondermann, Frank Friedrich Gellrich, Markus V","venue":null,"work_id":"d0aefd51-c108-44ad-80b3-e5a0c7db078b","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.899250Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:a42aedc30c0bef2fac463677fcf1feee34c704cfb0035c07912a159045086f23","observation_id":"0022eabe-eae4-4e43-a1d3-c13a3cc5b603","resolution":{"observed_at":"2026-08-07T12:43:00.520737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.334336Z","title":"Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions","venue":null,"work_id":"79163c3e-c14c-48d8-a532-4176963efe5b","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.933942Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:074825e4f86ff0ae6c2b69bc69d945c6201b574d7f31e29bfa926868e2c5e5cc","observation_id":"1aa9cc7f-e276-443d-bc5e-9ac402ac6630","resolution":{"observed_at":"2026-08-07T12:43:00.370899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.206892Z","title":"Reasoning Models Don’t Always Say What They Think","venue":null,"work_id":"01fdb46a-aaed-4c4b-bcfb-0548ea6c7438","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.003702Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:16539b064528de50d3818f1a39c86545d7ba4bd95b231d80d495a2a8b2f5094f","observation_id":"60895be4-10d9-4b8e-81bf-5fa59db03965","resolution":{"observed_at":"2026-08-07T12:43:00.262806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:00.138761Z","title":null,"venue":null,"work_id":"e2e0cc0a-fb1b-41ca-a07a-885699254625","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.037851Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:d5ca25d9f817fceee5244fd13881abed0e94894208aa12601a437b68951f25d0","observation_id":"a333b942-e8db-48f9-a0b5-f255f65bab64","resolution":{"observed_at":"2026-08-07T12:43:00.169216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13954","last_updated":"2024-05-22T19:39:05Z","snapshot_observed_at":"2026-08-03T22:27:29.954497Z","submitted_at":"2024-05-22T19:39:05Z","title":"What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13954","snapshot_observed_at":"2026-08-07T12:42:48.072916Z","title":"What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.072916Z"},"links":{"cited_paper":"/paper/2405.13954","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:bdf59b3f19dc7a4e7fad196fa0f4331fd32fcfa9dc0acb9f494f0613a4522483","observation_id":"3c51a8e8-fc08-426b-8379-074619e98521","resolution":{"observed_at":"2026-08-07T12:42:48.072916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06931","last_updated":"2024-05-11T06:30:13Z","snapshot_observed_at":"2026-07-06T18:12:55.888082Z","submitted_at":"2024-05-11T06:30:13Z","title":"Identifying Key Terms in Prompts for Relevance Evaluation with GPT Models","version":1},"cited_work":{"arxiv_id":"2405.06931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.06931","snapshot_observed_at":"2026-08-07T12:42:53.430644Z","title":"Identifying Key Terms in Prompts for Relevance Evaluation with GPT Models","venue":"cs.IR","work_id":"71b35120-619d-44da-8948-096f72ad578b","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.135694Z"},"links":{"cited_paper":"/paper/2405.06931","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:0f9c72086ac44dca70ddf4699cefd08ec8d5a93be08fce937fd3e284b5bd056a","observation_id":"3bebac39-b22f-4dc8-b55c-b2c82906396f","resolution":{"observed_at":"2026-08-07T12:42:53.527784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09604","last_updated":"2025-06-15T05:10:22Z","snapshot_observed_at":"2026-08-01T11:17:58.633629Z","submitted_at":"2025-02-13T18:55:13Z","title":"SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09604","snapshot_observed_at":"2026-08-07T12:42:48.196183Z","title":"SelfCite: Self-Supervised Align- ment for Context Attribution in Large Language Models, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.196183Z"},"links":{"cited_paper":"/paper/2502.09604","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:1b48ce9066c1036823f1be9e9387bc04d20600bde417f9eb60f6a84d667af6a2","observation_id":"e558dbca-b791-4367-8d0d-00a90e38525e","resolution":{"observed_at":"2026-08-07T12:42:48.196183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13752","last_updated":"2025-04-18T15:36:28Z","snapshot_observed_at":"2026-08-07T16:01:05.655232Z","submitted_at":"2025-04-18T15:36:28Z","title":"Learning to Attribute with Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13752","snapshot_observed_at":"2026-08-07T12:42:48.271464Z","title":"Learning to Attribute with Attention, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.271464Z"},"links":{"cited_paper":"/paper/2504.13752","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:2aec7b40d31dba1daa311bc8ba060f2a16d9526c0cce28dcbc5a4e06e963bff4","observation_id":"92323745-e460-41c4-859c-9603845f493c","resolution":{"observed_at":"2026-08-07T12:42:48.271464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.995566Z","title":"ContextCite: Attributing Model Generation to Context","venue":null,"work_id":"b087c3b3-ff03-4f94-8470-4cb49a458088","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.295228Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:0f80b53f561031ecfcf1cff3022fa121dfb791603c916cc55e8c386dbe6695f8","observation_id":"dbbf625c-d841-4454-9cb7-1168e8422158","resolution":{"observed_at":"2026-08-07T12:43:00.051715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.886879Z","title":"Current and future state of evaluation of large language models for medical summarization tasks.npj Health Systems, 2(1):1–13, February 2025","venue":null,"work_id":"d31d91d5-7c0e-4345-acde-f11b4df7512c","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.349220Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:657e68110d1bfd086dc56be1a61b7e6236bda52a17a328561006e214fa42b55d","observation_id":"25c4cf0f-5e78-460e-a01f-5b4faf721827","resolution":{"observed_at":"2026-08-07T12:42:59.957124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.727861Z","title":"Skinner, Ariel Dora Stern, and David Wennberg","venue":null,"work_id":"008ff7ac-5a40-4f31-aede-b436860d88d5","year":2019},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.427677Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:085623eb9c2977a597c3edfafc168eaa3ee486e2392751b78e54c454772f69be","observation_id":"5cd13f48-69b2-4551-8d11-b8913902161d","resolution":{"observed_at":"2026-08-07T12:42:59.790928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.578629Z","title":null,"venue":null,"work_id":"f69f07cd-e345-4b65-a894-381415f85530","year":2020},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.515752Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:aa07e284ee157c6f843adbcfa596450c001bb75b65575215b669f5903c9a7534","observation_id":"5f85e1c6-8d58-4b93-af8a-3d4ccc12c41c","resolution":{"observed_at":"2026-08-07T12:42:59.646744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.398208Z","title":"RAGAs: Automated Evaluation of Retrieval Augmented Generation","venue":null,"work_id":"7f237ff6-5aa5-4894-80ee-540f76edad7c","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.596357Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:2b171bf698bb2757f7994edcd99e27328a0dccd7bc78d28aadde055cbf5c1f5d","observation_id":"8646b9b0-66ce-46f4-a2ce-7eab95d78398","resolution":{"observed_at":"2026-08-07T12:42:59.489396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.290233Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630(8017):625–630, June 2024","venue":null,"work_id":"383ef59c-81b7-416a-b664-0dbcce6112b9","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.762620Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:f752322b5836b3e3b7e8e13845d59a9d7841bf7e26dfc538ba4e1699e43d358f","observation_id":"ebedf70f-cde7-4367-bdd8-4953545d8098","resolution":{"observed_at":"2026-08-07T12:42:59.358407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.145227Z","title":"CiteBench: A Benchmark for Scientific Citation Text Generation","venue":null,"work_id":"f8da7edf-fbea-40eb-be98-57c63217eab6","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.836182Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:0da9553e950bbb9c16b6e01d4e1a6b7bea16a58b7e751a047d274ede4b3cf380","observation_id":"956e18ff-2a35-4c26-9997-0ba048f0648e","resolution":{"observed_at":"2026-08-07T12:42:59.208232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:59.064076Z","title":"Enabling Large Language Models to Generate Text with Citations","venue":null,"work_id":"46bff77c-b1e6-406f-874b-b0534a6514a9","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.958146Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:84c94b5347b0b801a25c951aa2a02cd3f77a222eee016ea23baaf2d15162096c","observation_id":"d2fafe29-dff1-4c5e-8cf7-779d624989c9","resolution":{"observed_at":"2026-08-07T12:42:59.103626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.973644Z","title":"Koch, Matthias F","venue":null,"work_id":"72d19600-4c08-4b7a-ada4-9ec8b5e85c41","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.059462Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9b4110aaa40e4421e7238d379c8fd39bc6716b2cf5f3f9958af931769ad660fe","observation_id":"7ac6e3ac-3e43-45eb-9f47-5d1ed96a87bc","resolution":{"observed_at":"2026-08-07T12:42:59.021226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:42:49.147633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.147633Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:8423786a84afc9a0aa12dc175b391201d79913e9f7c47d664c7b07e947cce5e1","observation_id":"933f896e-63d6-4172-a219-43e18b2ff4bb","resolution":{"observed_at":"2026-08-07T12:42:49.147633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.899673Z","title":"Large Language Models lack essential metacognition for reliable medical reasoning.Nature Communications, 16(1):642, January 2025","venue":null,"work_id":"7cb47e3b-bef9-4b67-8dc4-2676dc93c102","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.223937Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:db12af576357e0d8d4e5c90359f1097d67b9048307ebb9f19f9e726478e296d8","observation_id":"3e4e0f94-6992-457e-849c-f11294198349","resolution":{"observed_at":"2026-08-07T12:42:58.926035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T12:42:49.331240Z","title":"A Survey on LLM-as-a-Judge, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.331240Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:46c75309c1367b883a4169dbabd24dcb03074cac19677f021a36009c6cd8cc6a","observation_id":"858e417c-5da7-4210-8a11-adbd5dc72bad","resolution":{"observed_at":"2026-08-07T12:42:49.331240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.795543Z","title":"McKone, Daniel K","venue":null,"work_id":"487834da-2d4c-4b9a-89d0-4835b9288007","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.421050Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:b025d8d5f295b46eaefc4f5354a72be64c3fffee066994fb485378bc43ce0a7d","observation_id":"414ad4e3-3197-4a1c-9a74-43f0ede88883","resolution":{"observed_at":"2026-08-07T12:42:58.849701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:42:49.523183Z","title":"Measuring Massive Multitask Language Understanding, January 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.523183Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:8c3f8b4d1dd2a3b9d991f859a4a74f603a766747169be2ac775518c97815e3bb","observation_id":"31db672f-c43e-4c3f-88fc-749c9f84ae2d","resolution":{"observed_at":"2026-08-07T12:42:49.523183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.711804Z","title":"Spurious","venue":null,"work_id":"ddfa7339-bfda-49d4-8034-25e9b664e466","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.623543Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:a3352aa70806811ea84551fb23827c23a7601a1cb45bfa8aefe33979397eae35","observation_id":"49b3ef4f-48b4-4ec8-89a4-4895b76b0d5b","resolution":{"observed_at":"2026-08-07T12:42:58.731232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.661227Z","title":"RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning","venue":null,"work_id":"c9d3e185-905b-42fa-beeb-6993ff29549d","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.696190Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:39586575287eb4cc440fdc19c22d3c5c0089723b55fdbe55757f4c7fb59738e0","observation_id":"554300d1-91e4-4681-a9c6-7bc73458aaec","resolution":{"observed_at":"2026-08-07T12:42:58.692217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.596046Z","title":"What Disease Does This Patient Have? A Large-Scale Open Domain Question Answering Dataset from Medical Exams.Applied Sciences, 11(14):6421, January 2021","venue":null,"work_id":"bfeaa5b8-bc2b-4fed-be5d-df55db8f82b4","year":2021},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.775976Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9d9cfc88230caa9582ad816cf815eaef598278c68ea96c75a4d572ec33b4d959","observation_id":"00d8c488-aa8c-4d0a-9c97-98bf7547a73a","resolution":{"observed_at":"2026-08-07T12:42:58.634175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.506039Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","venue":null,"work_id":"0cbbf3e3-26e3-4e2e-af4f-e281fc8c0c2b","year":2019},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.864087Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:a6cfa11e3cd6ff9dcd44d09675d52388d189c109cd3e5bd38828104be4be5318","observation_id":"e5109b91-6a33-4bdf-baf7-1efaf4f3b2da","resolution":{"observed_at":"2026-08-07T12:42:58.548413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.442305Z","title":"Effective Context Selection in LLM- Based Leaderboard Generation: An Empirical Study","venue":null,"work_id":"06e2241e-308e-4c71-9ee5-c57ac8ad31f4","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:49.945421Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e10a39b25f84b30aaa2f7f911b2fc50edbed438c1d6889fe7febc8a84cbef3ed","observation_id":"3e55d466-c684-44d0-8684-7aa9cee9bae2","resolution":{"observed_at":"2026-08-07T12:42:58.475273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.349129Z","title":"GPT versus Resident Physicians — A Benchmark Based on Official Board Scores.NEJM AI, 1(5):AIdbp2300192, April 2024","venue":null,"work_id":"47726b0c-4fc7-4556-8fa0-7fa5c4ef9d76","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.051191Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:5d6877892c991485bdf09a192b7101d5ac6fe13a908fa46c5d86b0a37e362396","observation_id":"e2f9176e-86cf-4e67-948e-bbbf3a2d91a8","resolution":{"observed_at":"2026-08-07T12:42:58.398558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.301350Z","title":"Baleen: robust multi-hop reasoning at scale via condensed retrieval","venue":null,"work_id":"30cb72d4-ae5d-4f50-a5b5-fe616ca61970","year":2021},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.133218Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:fb7b1c3fa0cb7e0080d4b706256ec5b37362e673b983006c02c61e98dbad2c3c","observation_id":"1f555e5e-8ec6-48f4-a962-e52dba343d5a","resolution":{"observed_at":"2026-08-07T12:42:58.326631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.250971Z","title":"Li, Vidhisha Balachandran, Shangbin Feng, Jonathan S","venue":null,"work_id":"b5435be5-560c-4ab9-8ac9-2166088e211d","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.234128Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9f96d3d19eba98d6d99e3486069d56c641136c3e30fdf6bc8d70a41396c8c9f0","observation_id":"f6434b9f-01aa-484f-a74c-930e59a325b9","resolution":{"observed_at":"2026-08-07T12:42:58.278636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.196874Z","title":"AttriBoT: A Bag of Tricks for Efficiently Approximating Leave-One-Out Context Attribution","venue":null,"work_id":"bdaed150-ebca-4e55-ac80-9eb45116edfc","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.304300Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:5d6f8aff773bdf26e97a7c51fa27ac1c0f28d51b89f1287892d6ace319b7437d","observation_id":"1f67cda6-ea80-4875-82ee-58408f191d64","resolution":{"observed_at":"2026-08-07T12:42:58.213188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.149278Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":"d459d576-a6d2-4671-9cd2-b6a78a6a828d","year":2022},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.380832Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9b6f31a597da80200a6373610cdba8fc3b8d7d98dc12ef6389ccaa155a4eac24","observation_id":"56fd67af-3220-4adc-af55-53276c8e0353","resolution":{"observed_at":"2026-08-07T12:42:58.169801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:58.050147Z","title":"Sara Mahdavi, Sushant Prakash, Anupam Pathak, Christopher Semturs, Shwetak Patel, Dale R","venue":null,"work_id":"2d650bec-b5bd-4bcb-b7b2-7e1cc2e3e1b7","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.460951Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:2bcf38db8a54f4613a9f9ed6f051fc93ff5e6c06189c3d1bfb8cb79c151770d4","observation_id":"64a4ff52-f181-4bd4-9cf0-d4020f078ffa","resolution":{"observed_at":"2026-08-07T12:42:58.127920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.914785Z","title":"Context Example Selection for LLM Generated Relevance Assessments","venue":null,"work_id":"2623c458-c765-47bd-8ea1-002358b7d101","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.551402Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:ca1154e9c710528d8594ca91c2f2491b4f572839c788f8add5fce45770b05f06","observation_id":"850b2af6-8012-430e-9571-07616fc036ad","resolution":{"observed_at":"2026-08-07T12:42:57.985087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:42:50.653743Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.653743Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:26cf8a96f14cbf8c002b162546e86d8794b572addb130a3d730b3f137ef774d4","observation_id":"2a0765b8-280c-4ef4-b802-90f2dee564db","resolution":{"observed_at":"2026-08-07T12:42:50.653743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.835576Z","title":"MedMCQA: A Large- scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","venue":null,"work_id":"98c8a037-3a3e-4f2f-9be4-95049fa87013","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.733849Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:c80a5bfdc0f83ee99f9636d8e09fec23487b9346a57cd7821fd8e300ebe76de6","observation_id":"6203c3c4-7570-4e33-a864-ccb56c174205","resolution":{"observed_at":"2026-08-07T12:42:57.903870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.604025Z","title":"Bowman, and Shi Feng","venue":null,"work_id":"95a2e3c8-9df0-45e3-895c-87257dc5a3e3","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.789115Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:49a09097e6ecaf9af8ea04549e373154c1773cdb2dd70817fc1f6c1b047b2518","observation_id":"ecd5867d-7b9f-47f0-9424-6e4c838f586b","resolution":{"observed_at":"2026-08-07T12:42:57.665395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.393665Z","title":null,"venue":null,"work_id":"7b9d8258-3cb4-4654-b6cf-2651d9489513","year":2015},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.838304Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:aaf2d2d2e57e42173f41c5109d357fd28c28865d62167501de56ea6d73eb2a76","observation_id":"41b30a8b-73d9-463b-89dd-a2fee267dff3","resolution":{"observed_at":"2026-08-07T12:42:57.510099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:42:50.889423Z","title":"Qwen2.5 Technical Report, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.889423Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:39d6dee4b65ecd9a73b06a1067896ab3a8f1503ff688855261f446c4620e1de1","observation_id":"572f7938-3816-440f-8d60-01db2dac20db","resolution":{"observed_at":"2026-08-07T12:42:50.889423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.172261Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","venue":null,"work_id":"bde2d995-4ac2-469c-8a47-2e02f00f52a2","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:50.989585Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e4586dd5b5ed5bb53bc2c53ecb093df7df9761e9162b3d65bddf86be8839c441","observation_id":"2a2b63cc-2784-4256-b394-ab564a89868e","resolution":{"observed_at":"2026-08-07T12:42:57.268717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:57.070412Z","title":"Towards Human-Centered Explainable AI: A Survey of User Studies for Model Explanations.IEEE Trans","venue":null,"work_id":"35c2f5a8-d440-439e-810d-9e1953a49227","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.056410Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:ddb9cf87fda21e95de8de3c4d954231adeca8ae9edafd0bd352a2809457e2aa1","observation_id":"9ad4cffd-c04b-41da-8b46-f9574415308d","resolution":{"observed_at":"2026-08-07T12:42:57.096053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:56.958333Z","title":null,"venue":null,"work_id":"0af31fa2-3de6-4576-a151-1a9b286ebbbb","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.118620Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:c18468e0a72cf536c7ee59eea4144d9a1dacfb38067d04882c45063faf85f69d","observation_id":"03c0d856-2e1d-4243-ae7b-523cd8d01e8a","resolution":{"observed_at":"2026-08-07T12:42:57.017659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:56.674875Z","title":"Jung, Maria Zerlik, Waldemar Hahn, Martin Sedlmayr, and Brita Sedlmayr","venue":null,"work_id":"da86376f-b917-440a-87f6-ef581dd37232","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.187616Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:1bbe8390fd971452d721f89a355be072890581dda5799b8897cee05e56495443","observation_id":"b6a919f8-20ca-478d-b579-b69def8345e1","resolution":{"observed_at":"2026-08-07T12:42:56.844972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.09799","last_updated":"2017-06-29T15:14:07Z","snapshot_observed_at":"2026-08-04T00:23:40.261802Z","submitted_at":"2017-06-29T15:14:07Z","title":"Relevance of Unsupervised Metrics in Task-Oriented Dialogue for Evaluating Natural Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.09799","snapshot_observed_at":"2026-08-07T12:42:51.272998Z","title":"Relevance of Unsupervised Metrics in Task-Oriented Dialogue for Evaluating Natural Language Generation, June 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.272998Z"},"links":{"cited_paper":"/paper/1706.09799","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:7e97b2ac5da078991bfd019cc35fd2382c26c3674f27751effca75507442cdad","observation_id":"8e97d18c-f69c-4a7f-a6a0-6b9cd9d21e2a","resolution":{"observed_at":"2026-08-07T12:42:51.272998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:51.346660Z","title":"Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.346660Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:fe6d4a184005f95b0b468f233c3d761cefc78ce30fd9d1b25e5df39e3f4f7ba6","observation_id":"618559c9-d48e-4adc-84e1-0c84343e0e0d","resolution":{"observed_at":"2026-08-07T12:42:51.346660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:56.429383Z","title":"Pfohl, Heather Cole-Lewis, Darlene Neal, Qazi Mamunur Rashid, Mike Schaekermann, Amy Wang, Dev Dash, Jonathan H","venue":null,"work_id":"887e505f-8271-44d6-ac18-8c1b644f7950","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.410573Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:32584fc405e06b279d741909b7e33fe9b1700bc20d6b8f50231102123ed93721","observation_id":"5f00423a-8a68-4d61-805b-db539a1b02dc","resolution":{"observed_at":"2026-08-07T12:42:56.543815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:56.120966Z","title":"Don’t Use LLMs to Make Relevance Judgments.Information Retrieval Research, 1(1):29–46, March 2025","venue":null,"work_id":"3e4b01a0-b167-497d-ba84-6944863770e8","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.483199Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e53b2fd3aa56f23eb61f8cf2d24c9f09e3057a01935fe16fbf98ee94fd4727f3","observation_id":"00ce585b-331c-4895-a2de-ba017a47fc50","resolution":{"observed_at":"2026-08-07T12:42:56.273646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.896862Z","title":"RadQA: A Question Answer- ing Dataset to Improve Comprehension of Radiology Reports","venue":null,"work_id":"f5978b51-6236-4657-9d7e-805c86def0de","year":2022},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.499100Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e52b917778a210b0feaf3e6fd12c57cfd4e14c8ddcfac84cc2d0ef0a43d9e3c5","observation_id":"332a4770-99a4-4ef3-a481-e6fccb35aeae","resolution":{"observed_at":"2026-08-07T12:42:56.005774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.734756Z","title":null,"venue":null,"work_id":"b5e0fb55-c59a-4cde-a028-e60bebd059d5","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.519320Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:4987314533f132f03bbb19fd358cc8016e1c6a1ba65c21ba94bea7b5f925c319","observation_id":"131b2e92-d6ca-4370-ae6e-8b32163ac763","resolution":{"observed_at":"2026-08-07T12:42:55.813354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12031","last_updated":"2023-08-17T17:19:02Z","snapshot_observed_at":"2026-08-06T16:28:29.854930Z","submitted_at":"2023-05-19T23:07:09Z","title":"Clinical Camel: An Open Expert-Level Medical Language Model with Dialogue-Based Knowledge Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12031","snapshot_observed_at":"2026-08-07T12:42:51.574225Z","title":"Lawler, Jimmy Ba, Rahul G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.574225Z"},"links":{"cited_paper":"/paper/2305.12031","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:df755c3f662308f9eb2e4429248c27becd1fe759522c13354382c6e571dcc272","observation_id":"5d75952b-8710-4d0a-be25-59fb2c34cfd8","resolution":{"observed_at":"2026-08-07T12:42:51.574225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.538981Z","title":"Prompt engineering in consistency and reliability with the evidence-based guideline for LLMs","venue":null,"work_id":"db7ef72a-3766-4709-833f-8e540ea883b8","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.692771Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:255359e241292598f2b1f49705e539eee0bfb1b9c941665a3ac0d4a06bc6df28","observation_id":"4718ff6a-cf92-411f-8310-476c7ff3d371","resolution":{"observed_at":"2026-08-07T12:42:55.610609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00993","last_updated":"2025-04-04T18:29:18Z","snapshot_observed_at":"2026-08-07T16:16:51.008728Z","submitted_at":"2025-04-01T17:31:44Z","title":"MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00993","snapshot_observed_at":"2026-08-07T12:42:51.752953Z","title":"MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.752953Z"},"links":{"cited_paper":"/paper/2504.00993","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:0be63b3dde6e9cd2dacae3bcc844c2ae72ffaa0789d0de5625ea276d2cfd8d2d","observation_id":"9773ce0e-f307-480e-abf7-c1e95ab90dc7","resolution":{"observed_at":"2026-08-07T12:42:51.752953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.438328Z","title":"An automated framework for assessing how well LLMs cite relevant medical references.Nature Communications, 16(1):3615, April 2025","venue":null,"work_id":"ba866755-4ccc-4551-9294-62803fff1355","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.855274Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:282c16e4d1052581bc1a5e4fa6f15e5b973c65825f4f16250515a498d3dae4a6","observation_id":"012df2de-7e4e-421c-8f92-ba936bbb4b9f","resolution":{"observed_at":"2026-08-07T12:42:55.489658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.302564Z","title":"CARES: A Comprehensive Benchmark of Trust- worthiness in Medical Vision Language Models.Advances in Neural Information Processing Systems, 37:140334–140365, December 2024","venue":null,"work_id":"90a413cb-83b8-411b-8179-0e7a61c2a742","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:51.968438Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:d9dfd6a4a2bce76f56465d30df388c83d565c05ed5b47fe0a90fe354d9c821c1","observation_id":"1758cd8c-4c30-4e3c-9b32-823590261821","resolution":{"observed_at":"2026-08-07T12:42:55.353717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.142194Z","title":"Harnessing Biomedical Literature to Calibrate Clinicians’ Trust in AI Decision Support Systems","venue":null,"work_id":"76ca65cb-4441-4385-bda3-ff03e101d6a4","year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.018572Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:58d7496c73d03ed6e7748e18ed871514a9d8c4a839f39c86089137434b150605","observation_id":"fa70b999-29d9-4a59-a506-b046a9b0b448","resolution":{"observed_at":"2026-08-07T12:42:55.221327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:55.046796Z","title":"A survey of datasets in medicine for large language models.Intelligence & Robotics, 4(4):457–478, December 2024","venue":null,"work_id":"49eba6e6-1e05-49b7-9666-9698fcb5da95","year":2024},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.106367Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:714013bd3ec9549c552a4866bf684196afb829d9d3b97dda536b39e58290e128","observation_id":"edca9806-32b8-4907-b8a0-62b4c8b149a1","resolution":{"observed_at":"2026-08-07T12:42:55.092113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:54.894231Z","title":"Meyer, and Steffen Eger","venue":null,"work_id":"161ea733-de4d-4cf8-af88-b02fe6bae602","year":2019},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.206653Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:0f56dde3822ce88901c1ca836547a7e64bbd976116c75cacb6fd76d5eb57184e","observation_id":"ed446d7e-86b8-46f0-bad2-1b772a81272b","resolution":{"observed_at":"2026-08-07T12:42:54.974189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:52.346225Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.346225Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:a48889e7c4e64cf7cdcdd570cf8805bf6f6072a79421c21c0f5830cbe0efd6fe","observation_id":"30d7ea68-3a86-48f9-8f68-d268b451553a","resolution":{"observed_at":"2026-08-07T12:42:52.346225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:54.704464Z","title":"Melton, James Zou, and Rui Zhang","venue":null,"work_id":"1ab0f6c6-284c-4676-8c24-ccb5b19b6643","year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.455186Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:08ad17ffaf08a8ab99a30616f81d2052031e3ff654c78a43db003d4ab0677475","observation_id":"1ee80f7e-a2d4-4c6b-a799-220692457244","resolution":{"observed_at":"2026-08-07T12:42:54.796467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-07-06T20:28:24.203633Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-07T12:42:52.565185Z","title":"high relevance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.565185Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e422b0947d66acc2fdb6e75e781fd2de9122128b70d87af1b1d5212f9fed3efd","observation_id":"f548da07-6d9c-438d-bc51-f2528ac72cc9","resolution":{"observed_at":"2026-08-07T12:42:52.565185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:54.537277Z","title":null,"venue":null,"work_id":"24b0dd67-4dab-48a3-a113-1aa111fc3f68","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.655992Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:37d2e896255c96f535f4e92478fd9edc4bbb0a5f5d09ef2aeafaefcac7445376","observation_id":"3bf35d46-e107-48e7-bb1b-8f8c404da2b8","resolution":{"observed_at":"2026-08-07T12:42:54.605443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:54.313921Z","title":null,"venue":null,"work_id":"7653eff6-effe-4912-8990-78834bcde06f","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.759621Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:8fc67723fc145c1a9def25a2572ef1273ee7a040f4474f1d21860621fca4aaaf","observation_id":"e67608e9-17db-4bdc-8e0d-51711bed76e4","resolution":{"observed_at":"2026-08-07T12:42:54.420889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:54.117989Z","title":null,"venue":null,"work_id":"d969ff98-810e-44ab-913b-b29dd7674772","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.868840Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9c635b16e9708de94e62441422f93525d6cf7af3e0f60cdce61e1127769d90cb","observation_id":"753df1bd-8613-42a7-8c2a-9c5e9cbedbed","resolution":{"observed_at":"2026-08-07T12:42:54.180946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:53.981523Z","title":"Her new job involves walking several miles daily across a large facility","venue":null,"work_id":"523be3ab-6e82-4707-9008-f2033c2faa6c","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:52.971780Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:9037c231ad98e06965ebd86603b042aba1a7fc7ead5b3a97d001ead6f11fc06f","observation_id":"76b99462-dda6-4b93-ac42-1f74f8952046","resolution":{"observed_at":"2026-08-07T12:42:54.061125Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:53.714008Z","title":"Towards Digital Sustainability in Health Care: Developing Digital Health Products through Data-Driven User Insights","venue":null,"work_id":"bb491722-93cc-4015-9d80-d3b551245d59","year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:53.123407Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:e833a888cc7ce632d5f051d84143a7d0d08a43d6aefe39f544584b7c3d5be809","observation_id":"12000119-02f6-4bc8-b0e2-c5e33039fb90","resolution":{"observed_at":"2026-08-07T12:42:53.800495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08037","last_updated":"2023-02-10T20:04:05Z","snapshot_observed_at":"2026-07-06T14:31:07.280398Z","submitted_at":"2022-12-15T18:45:29Z","title":"Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08037","snapshot_observed_at":"2026-08-07T12:42:47.761883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:47.761883Z"},"links":{"cited_paper":"/paper/2212.08037","citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:2edfa155f5be1167948aa29e9d023fe72b5f6164a8f59f0a1a7569aec2b299df","observation_id":"d72d57a3-c8b8-4355-b7c5-2d08ac677448","resolution":{"observed_at":"2026-08-07T12:42:47.761883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:48.690834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:48.690834Z"},"links":{"citing_paper":"/paper/2505.24040"},"observation_digest":"sha256:25fa3191f71a1b367c645048c3eab7ed34900340ea828fd89de420bd15aaaec1","observation_id":"e2972f1e-6fff-451e-b275-05a5a6bfbc06","resolution":{"observed_at":"2026-08-07T12:42:48.690834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24040","last_updated":"2025-05-29T22:23:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:35:11.563117Z","submitted_at":"2025-05-29T22:23:48Z","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":46},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 3 inbound Pith citation observations for arXiv:2505.24040."}