{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3e8872bd9caa65f7c954beef168f253924b7aa7e4e94b8d3043a2a490c91401","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:33.202015Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":169,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2401.07345","last_updated":"2026-04-07T05:20:51Z","snapshot_observed_at":"2026-07-06T17:15:22.551637Z","submitted_at":"2024-01-14T19:05:45Z","title":"Can an LLM Learn Preferences from Choice Data?","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-24T04:54:12.367946Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2401.07345"},"observation_digest":"sha256:97c6788b63073618b09046263424dfbb2feee1c1b8e8adf58f30e872e70517bd","observation_id":"fd1fe60a-68e2-4196-a587-1c877d8a65b3","resolution":{"observed_at":"2026-05-24T04:56:01.019110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-05-15T17:13:22.759147Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2404.18416"},"observation_digest":"sha256:aa545ac440b83bfb0183d0d15bc23df812ac8e821b840512efefd174950ec58d","observation_id":"40cf7b2b-c48c-4b16-bb3f-232de0c584ce","resolution":{"observed_at":"2026-05-15T17:13:22.971803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2405.07960","last_updated":"2025-05-25T02:19:37Z","snapshot_observed_at":"2026-07-30T08:34:47.046912Z","submitted_at":"2024-05-13T17:38:53Z","title":"AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T13:53:19.535482Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2405.07960"},"observation_digest":"sha256:c1611c88fce4260a0d148925e9f135cc16cbfbad4c7b0a8ef4846bbca6ea9ce9","observation_id":"a519c327-9818-40e0-b5f5-d09500c33bca","resolution":{"observed_at":"2026-05-21T13:53:19.586587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T11:27:58.098484Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2406.07496"},"observation_digest":"sha256:95a57ca209c69ad164c7d957a113e5216846f09f385cb96b0235a67016087230","observation_id":"009b931c-2c08-40bb-a714-12ac3ad3bc94","resolution":{"observed_at":"2026-05-13T11:27:58.162073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T18:40:14.847351Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2410.21276"},"observation_digest":"sha256:68f88f1f845a2eaddf1d6edf3709156c64e920caeefe59592539c1a4e06ad2bc","observation_id":"4b101104-0530-4786-99c8-f4f0c95200ff","resolution":{"observed_at":"2026-05-23T18:43:19.077599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T12:36:50.060335Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2412.18925"},"observation_digest":"sha256:05ecaab163213a718ab33c3dd4c6ec82d7953d89dafe8d63ff0a98a0d66ac99a","observation_id":"2c9d2596-c233-4a81-91f0-a9f73bb0d42f","resolution":{"observed_at":"2026-05-15T12:36:50.275415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2502.07143","last_updated":"2026-05-08T16:41:33Z","snapshot_observed_at":"2026-08-02T16:25:18.518932Z","submitted_at":"2025-02-11T00:13:52Z","title":"Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T03:35:56.594095Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2502.07143"},"observation_digest":"sha256:da934304afd282bf1af6867cf34020b03e21b08e162643272a5d07f5280013f3","observation_id":"590815fc-94c2-46c3-b16f-481ce68d607f","resolution":{"observed_at":"2026-05-23T03:37:27.794889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:5d60d20bf45e38cb957728d51d3d54fb4e1f5b4257e719e27a3313fc0ef6f892","observation_id":"f8520b19-0c50-45f4-94db-ffbdc7d9dc38","resolution":{"observed_at":"2026-05-22T21:42:11.068056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-07T05:19:33.202015Z","title":"T., Zhang, S., Carignan, D., Edgar, R., Fusi, N., King, N., Larson, J., Li, Y., Liu, W., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08349","last_updated":"2025-06-10T02:07:33Z","snapshot_observed_at":"2026-08-07T05:10:54.764377Z","submitted_at":"2025-06-10T02:07:33Z","title":"Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:33.202015Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2506.08349"},"observation_digest":"sha256:a5c8afa1c671c2120b6a60a19459c284efc22e89bb852d108f8ce69c842a35c8","observation_id":"3cd2eaad-b15f-42f2-bf48-c9c9468ef675","resolution":{"observed_at":"2026-08-07T05:19:33.202015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-07T05:15:46.275717Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08507","last_updated":"2025-06-12T07:40:49Z","snapshot_observed_at":"2026-08-07T05:06:34.538013Z","submitted_at":"2025-06-10T07:04:25Z","title":"MasHost Builds It All: Autonomous Multi-Agent System Directed by Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:15:46.275717Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2506.08507"},"observation_digest":"sha256:88c659a81b42addb934eb701d6820eec6c2ced1a300dc9bc0abb05e0e23b1296","observation_id":"c6a7b146-9077-46f3-ac73-8b87b1a0b477","resolution":{"observed_at":"2026-08-07T05:15:46.275717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T23:41:46.615026Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16899","last_updated":"2025-07-13T11:10:27Z","snapshot_observed_at":"2026-08-06T23:35:34.055344Z","submitted_at":"2025-06-20T10:46:35Z","title":"Towards Effective Complementary Security Analysis using Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:46.615026Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2506.16899"},"observation_digest":"sha256:4997c7f96fceeb6164bd0b7302220f9d78920f296a9dd4ba497d9b1f69fa2045","observation_id":"d5bf19ba-eb2d-412d-a731-3b80054b4a6a","resolution":{"observed_at":"2026-08-06T23:41:46.615026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T21:59:59.632348Z","title":"Can generalist foundation models outcompete special-purpose tuning? Case study in medicine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22852","last_updated":"2025-06-28T11:26:31Z","snapshot_observed_at":"2026-08-06T22:47:43.885699Z","submitted_at":"2025-06-28T11:26:31Z","title":"Knowledge Augmented Finetuning Matters in both RAG and Agent Based Dialog Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:59.632348Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2506.22852"},"observation_digest":"sha256:4174f9d1f9efc740af3b98b737b02706ba989ab38fa4d33ccf4a750cfcbcd257","observation_id":"e6cd44f3-eb7c-4740-8564-9cdf7933fda2","resolution":{"observed_at":"2026-08-06T21:59:59.632348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T19:58:36.328613Z","title":"T.; Zhang, S.; Carignan, D.; Edgar, R.; Fusi, N.; King, N.; Larson, J.; Li, Y.; Liu, W.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04142","last_updated":"2025-07-05T19:43:54Z","snapshot_observed_at":"2026-08-06T19:52:02.081681Z","submitted_at":"2025-07-05T19:43:54Z","title":"Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:58:36.328613Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2507.04142"},"observation_digest":"sha256:d7e9e3ae703a833e9cebcb26152f4d8673466987bfa5ac4ea2fb11b1f6d019f2","observation_id":"11300047-0100-41d6-8187-d94d83fae0bd","resolution":{"observed_at":"2026-08-06T19:58:36.328613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T18:11:17.584586Z","title":"T., Zhang, S., Carignan, D., Edgar, R., Fusi, N., King, N., Larson, J., Li, Y., Liu, W., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09037","last_updated":"2025-07-11T21:33:38Z","snapshot_observed_at":"2026-08-06T18:03:23.256891Z","submitted_at":"2025-07-11T21:33:38Z","title":"ALIGN: Prompt-based Attribute Alignment for Reliable, Responsible, and Personalized LLM-based Decision-Making","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:17.584586Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2507.09037"},"observation_digest":"sha256:c83edd5dc04202a5fd4002ad671380d1e361205f6587efcd3e986d323673d835","observation_id":"da4f5f8d-d53a-454c-811c-5521ea9f913b","resolution":{"observed_at":"2026-08-06T18:11:17.584586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-06T14:42:18.370147Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18143","last_updated":"2025-07-25T06:40:44Z","snapshot_observed_at":"2026-08-06T16:38:03.240112Z","submitted_at":"2025-07-24T07:06:30Z","title":"HIVMedQA: Benchmarking large language models for HIV medical decision support","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:18.370147Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2507.18143"},"observation_digest":"sha256:8c7a1c336e2245fdad36767559206965b1a59efd4ebc99c4d547602c68b70796","observation_id":"9850c560-7d20-4d05-8d5e-bf9bf6e0f933","resolution":{"observed_at":"2026-08-06T14:42:18.370147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2508.05012","last_updated":"2026-04-03T20:54:14Z","snapshot_observed_at":"2026-08-06T20:40:15.268946Z","submitted_at":"2025-08-07T03:49:56Z","title":"Making Prompts First-Class Citizens for Adaptive LLM Pipelines","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T00:58:13.697256Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2508.05012"},"observation_digest":"sha256:214de1eacbc2dc38c9e19fb0481d5f1dbb7a4adbe7d57d70c7a3d11bd82ffd61","observation_id":"ec171c18-daf7-4b0b-8ba4-81621992f1ce","resolution":{"observed_at":"2026-05-19T01:01:56.445463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T05:30:11.982290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09705","last_updated":"2025-09-05T17:31:14Z","snapshot_observed_at":"2026-08-06T16:38:04.814811Z","submitted_at":"2025-09-05T17:31:14Z","title":"The Non-Determinism of Small LLMs: Evidence of Low Answer Consistency in Repetition Trials of Standard Multiple-Choice Benchmarks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T05:30:11.982290Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.09705"},"observation_digest":"sha256:c1294c4285b2ad519031a2f898b1a43572d565833d9755b18f6f5cb2a4c3d86d","observation_id":"32e84c90-d21c-415e-9b3a-d8d4390ea1a3","resolution":{"observed_at":"2026-08-05T05:30:11.982290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-04T17:26:38.354877Z","title":"T., Zhang, S., Carignan, D., Edgar, R., Fusi, N., King, N., Larson, J., Li, Y., Liu, W., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10963","last_updated":"2025-09-13T19:44:42Z","snapshot_observed_at":"2026-08-04T17:26:36.598796Z","submitted_at":"2025-09-13T19:44:42Z","title":"Testing for LLM response differences: the case of a composite null consisting of semantically irrelevant query perturbations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:26:38.354877Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.10963"},"observation_digest":"sha256:d6d47dc6d39ef18dfb67f5835eac5e8055c241f40ecebf53b6e8d542cb613f26","observation_id":"797b5eb6-1460-48b0-b778-10461e3117c3","resolution":{"observed_at":"2026-08-04T17:26:38.354877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-04T16:43:19.371532Z","title":"Can generalist foundation models outcompete special-purpose tuning? Case study in medicine [Internet]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12194","last_updated":"2026-05-24T19:16:03Z","snapshot_observed_at":"2026-08-06T16:38:02.742645Z","submitted_at":"2025-09-15T17:54:51Z","title":"Teaching large language models to reason like expert diagnosticians","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:43:19.371532Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.12194"},"observation_digest":"sha256:88d1b6881b96d78d7e01167619c7cfbc8618e8ba2d638ace3f74c99c0b5f305d","observation_id":"59938cd2-eb3b-481c-9f91-ce3c1fd65b46","resolution":{"observed_at":"2026-08-04T16:43:19.371532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2509.24186","last_updated":"2026-04-06T07:24:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T02:06:13Z","title":"Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-18T13:16:19.744864Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.24186"},"observation_digest":"sha256:5d6216dfe8a5ca9fd27665f4f5c3abc0501ba83bb804280485fd688dadd8913c","observation_id":"a36f5af5-f04a-407c-a62f-048d90e1344c","resolution":{"observed_at":"2026-05-18T13:16:24.110939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-04T13:51:49.123850Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24739","last_updated":"2026-07-22T03:37:07Z","snapshot_observed_at":"2026-08-04T13:51:45.248849Z","submitted_at":"2025-09-29T13:03:57Z","title":"Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:49.123850Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2509.24739"},"observation_digest":"sha256:237122367fefbe86daa1bc650ae9887e68100ca5dc9140a7da776d4486d27e8b","observation_id":"acac3c1a-a841-4656-8c0a-1cf74bfbb339","resolution":{"observed_at":"2026-08-04T13:51:49.123850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-03T14:01:05.823992Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09721","last_updated":"2025-12-26T13:47:42Z","snapshot_observed_at":"2026-08-06T16:38:01.077844Z","submitted_at":"2025-12-26T13:47:42Z","title":"Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:01:05.823992Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2601.09721"},"observation_digest":"sha256:8ca33627d65a2776990ab2702507fef29cef6ae56ca5328764c477daa08b84a9","observation_id":"ca6da547-36a8-400f-8806-751ac54a6d42","resolution":{"observed_at":"2026-08-03T14:01:05.823992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-04T06:15:35.881009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03541","last_updated":"2026-08-03T15:56:09Z","snapshot_observed_at":"2026-08-06T23:37:33.335208Z","submitted_at":"2026-02-03T13:56:47Z","title":"Group Selection as a Safeguard Against AI Substitution","version":2},"reference_index":3440,"source":"pdf_text","source_observed_at":"2026-08-04T06:15:35.881009Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2602.03541"},"observation_digest":"sha256:6dfa7a64c7bc15529a053ae066844d2530516c5f62a0e15bcf64269f0bb4843c","observation_id":"29678fc4-f2d5-4061-beee-70719ec01730","resolution":{"observed_at":"2026-08-04T06:15:35.881009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2603.05308","last_updated":"2026-06-01T00:49:17Z","snapshot_observed_at":"2026-08-01T16:17:18.880743Z","submitted_at":"2026-03-05T15:48:43Z","title":"Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T11:41:26.274423Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2603.05308"},"observation_digest":"sha256:658d3f298c4523b955bef73abbce660f322875a250b980f867ade410e64ee8b7","observation_id":"3dd5afd2-3ac7-426d-96df-443e2c8b4ed8","resolution":{"observed_at":"2026-05-21T11:44:09.290435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2604.08559","last_updated":"2026-03-17T09:03:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-17T09:03:09Z","title":"Medical Reasoning with Large Language Models: A Survey and MR-Bench","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T10:21:39.892271Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2604.08559"},"observation_digest":"sha256:1560c0ecf1eae2342837d82e28e3880a55f628b4475518100ea5144a6b27e05f","observation_id":"cee22403-0557-4751-bce5-60d25e451921","resolution":{"observed_at":"2026-05-15T10:25:26.711903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2604.10535","last_updated":"2026-04-12T08:56:15Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:56:15Z","title":"Evaluating Small Open LLMs for Medical Question Answering: A Practical Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:26.427585Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2604.10535"},"observation_digest":"sha256:e8c355f67e70374127c28471184a03d67ebd641d2896ec2873e135b9bffd0f02","observation_id":"cf618542-ba1f-4615-af0c-2cef29eebcfd","resolution":{"observed_at":"2026-05-11T09:16:00.355002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2604.15203","last_updated":"2026-04-16T16:28:16Z","snapshot_observed_at":"2026-07-31T17:43:46.319715Z","submitted_at":"2026-04-16T16:28:16Z","title":"MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T11:19:15.920545Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2604.15203"},"observation_digest":"sha256:71ba06099a70c644acbc0670b240198372f5b7dc9c2d15b5967f9505e20c163a","observation_id":"170f340b-0b20-49c0-867d-b02514f1934b","resolution":{"observed_at":"2026-05-10T11:20:10.025162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.04012","last_updated":"2026-05-10T21:01:37Z","snapshot_observed_at":"2026-08-02T05:52:52.199459Z","submitted_at":"2026-05-05T17:36:12Z","title":"SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T16:17:39.923337Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.04012"},"observation_digest":"sha256:fd072eb5c7b65fa5a4867d838d03c59313110acf0060fb0335ef9ecf93c9125b","observation_id":"3dfccda0-0ba3-4105-aaee-76073463d261","resolution":{"observed_at":"2026-05-11T23:46:53.492347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.04012","last_updated":"2026-05-10T21:01:37Z","snapshot_observed_at":"2026-08-02T05:52:52.199459Z","submitted_at":"2026-05-05T17:36:12Z","title":"SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:21:16.825681Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.04012"},"observation_digest":"sha256:cd0f14f0de68b16bd97a7171ec83b38ff4013aabfe8fdef717f4034eee932a94","observation_id":"c4e771f2-2391-4501-9761-faeee07a3991","resolution":{"observed_at":"2026-05-12T07:41:42.849502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.05715","last_updated":"2026-05-07T05:58:38Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:58:38Z","title":"Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T11:42:16.090162Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.05715"},"observation_digest":"sha256:189029ff9400660959934ac520b8094b9eadb73188d9e511521a52b0da98369a","observation_id":"956e374c-8716-464b-93d1-484ce7d98ddd","resolution":{"observed_at":"2026-05-11T19:31:10.702844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.08813","last_updated":"2026-05-09T09:03:54Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T09:03:54Z","title":"AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:38.617652Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.08813"},"observation_digest":"sha256:188f0b63e14d0bf335b59ba153a39cbc991cf9d2b7dedde2088f5ad3f722132b","observation_id":"b770c0a4-751a-40e3-ad07-ae5342690514","resolution":{"observed_at":"2026-05-12T07:46:26.957906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.10286","last_updated":"2026-05-11T09:46:41Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:46:41Z","title":"AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T05:10:02.941396Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.10286"},"observation_digest":"sha256:91cdc0ae4dea619d24b2a2ab5cb8635b8f3842013bdf887ff96eef8d4cb89c02","observation_id":"ec767918-802c-497d-a451-f65b1ab606e5","resolution":{"observed_at":"2026-05-12T05:11:21.948174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.10286","last_updated":"2026-05-11T09:46:41Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:46:41Z","title":"AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-12T05:10:02.941396Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.10286"},"observation_digest":"sha256:f70efcdfdcffd67130a95d3ebce74f025797f9fffa1cb15d7e5140dc04f0b55b","observation_id":"ed19ff2b-9d15-4ee3-8e36-240d3f797754","resolution":{"observed_at":"2026-05-12T05:31:25.879478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.16630","last_updated":"2026-05-19T13:37:41Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T20:53:22Z","title":"PrivScope: Task-scoped Disclosure Control for Hybrid Agentic Systems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T16:17:37.824542Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.16630"},"observation_digest":"sha256:2c09881260d1241972604c4d286cedbc9d8f2365b1f023b8a7baaec2ab918e88","observation_id":"d9ca0eea-1b14-4e43-95a8-113184e51f75","resolution":{"observed_at":"2026-05-20T16:18:37.473848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.20425","last_updated":"2026-05-19T19:22:21Z","snapshot_observed_at":"2026-08-06T18:52:48.075630Z","submitted_at":"2026-05-19T19:22:21Z","title":"AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T07:05:28.416552Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.20425"},"observation_digest":"sha256:e88ffb111710a0e736915709d924ad22abf446f47923080141ff7c86324c1c9f","observation_id":"e7d11e7c-7a1a-4370-b91e-59d5084f1092","resolution":{"observed_at":"2026-05-21T07:09:46.418476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.20525","last_updated":"2026-05-19T21:54:12Z","snapshot_observed_at":"2026-07-06T23:31:08.671011Z","submitted_at":"2026-05-19T21:54:12Z","title":"NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T06:54:55.254082Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.20525"},"observation_digest":"sha256:9e9734dd415a90dbf9bcea9984dabd7f65e6c0c3e93daf46e90f5f7162550d51","observation_id":"3677f857-2551-467d-8867-a9b0271e0562","resolution":{"observed_at":"2026-05-21T06:59:45.811730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.25878","last_updated":"2026-07-17T05:05:42Z","snapshot_observed_at":"2026-08-02T13:12:45.114532Z","submitted_at":"2026-05-25T14:04:56Z","title":"A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T19:23:57.130409Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.25878"},"observation_digest":"sha256:3efdf912a8ec43d640092bd3955b4e8b573a4318b592b251cf9ca55fd1c48009","observation_id":"d8b688e7-c21b-4f51-bcb4-ea292fe8dc8f","resolution":{"observed_at":"2026-06-29T19:33:54.378091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-02T13:12:52.371448Z","title":"60.Ochi, M., Komura, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25878","last_updated":"2026-07-17T05:05:42Z","snapshot_observed_at":"2026-08-02T13:12:45.114532Z","submitted_at":"2026-05-25T14:04:56Z","title":"A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T13:12:52.371448Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.25878"},"observation_digest":"sha256:5d2edb9b16a50bf2d0dfe5a2edb4cb363baf58575de6b30cf16285d1ed316e13","observation_id":"2ade2156-6d2f-4fea-89c3-df43243b4886","resolution":{"observed_at":"2026-08-02T13:12:52.371448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.29368","last_updated":"2026-05-28T05:12:41Z","snapshot_observed_at":"2026-08-04T18:35:41.712237Z","submitted_at":"2026-05-28T05:12:41Z","title":"SURGENT: A Surgical Multi-Agent Assistance System Across the Perioperative Workflow","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T08:15:14.484574Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.29368"},"observation_digest":"sha256:ee0f95783a5cebde6bf93fe764a0c66a27282ace00447ea2752aacaf324994dd","observation_id":"e7045d5b-d427-4604-8f75-4b2dd5c3f277","resolution":{"observed_at":"2026-06-29T08:23:15.680465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2605.31410","last_updated":"2026-05-29T15:13:53Z","snapshot_observed_at":"2026-08-03T04:10:32.210591Z","submitted_at":"2026-05-29T15:13:53Z","title":"FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:12:28.812691Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2605.31410"},"observation_digest":"sha256:28be67d815bb984fc2aaa080bd3951a34eef0a6c71318878e11c31ba4f7056a8","observation_id":"29bac44a-75a6-472b-b992-b5726d270afa","resolution":{"observed_at":"2026-07-01T19:36:09.250257Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2606.05241","last_updated":"2026-06-03T07:11:36Z","snapshot_observed_at":"2026-08-06T18:31:39.570690Z","submitted_at":"2026-06-03T07:11:36Z","title":"Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T06:16:54.162410Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2606.05241"},"observation_digest":"sha256:b0f7967f2daf90b1717fdd7a2769b69ec326d723e8f9f9b711bee3f672a436be","observation_id":"81fec4d2-6705-4bd2-8830-503868681192","resolution":{"observed_at":"2026-07-02T08:16:47.679305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2606.05481","last_updated":"2026-06-03T22:00:29Z","snapshot_observed_at":"2026-08-02T18:59:33.687986Z","submitted_at":"2026-06-03T22:00:29Z","title":"Towards Unified and Data-Efficient Prognostics and Health Management with Tabular Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T06:42:59.183555Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2606.05481"},"observation_digest":"sha256:74cb55cba4e73e65204b0eec09646e3b2e87841615135e2a9191217e0cef2dd8","observation_id":"98cd100f-046e-4cab-8e8d-401729f7e5c9","resolution":{"observed_at":"2026-07-02T07:46:46.098161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2606.12854","last_updated":"2026-06-11T03:38:46Z","snapshot_observed_at":"2026-08-04T18:43:41.287797Z","submitted_at":"2026-06-11T03:38:46Z","title":"Small LLMs for Biomedical Claim Verification: Cost-Effective Fine-Tuning, Structural Dataset Shortcuts, and Cross-Domain Generalization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T06:59:52.082717Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2606.12854"},"observation_digest":"sha256:3ccc226504d3e30dac3393712074be50e8b0a14e50dbe055fb52b4221999031c","observation_id":"6fcbd93a-2fe8-4267-a2a0-dd2e2d0d2d03","resolution":{"observed_at":"2026-07-03T14:38:29.085245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2606.28332","last_updated":"2026-05-26T14:39:18Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-05-26T14:39:18Z","title":"When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-30T11:03:52.230759Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2606.28332"},"observation_digest":"sha256:9cc7a4d89353593a76e822a1b8658ccd2173bc3d24446896bf969861406c7644","observation_id":"cc07f78c-1766-4260-ba4f-012bf3996a37","resolution":{"observed_at":"2026-06-30T11:04:37.476215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2606.28900","last_updated":"2026-06-27T13:14:16Z","snapshot_observed_at":"2026-07-07T00:02:57.622708Z","submitted_at":"2026-06-27T13:14:16Z","title":"MedEvoEval: Evaluating Continual Evolution of Doctor Agents through Simulated Clinical Episodes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T09:33:50.358159Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2606.28900"},"observation_digest":"sha256:7213c13240be3e391936c4db117eecde197cc1ee1e2e1cd7cc35ea722be13fc9","observation_id":"76eaf936-269e-4997-9b52-d97e308b3a72","resolution":{"observed_at":"2026-06-30T09:34:34.377344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2607.01440","last_updated":"2026-07-01T20:02:55Z","snapshot_observed_at":"2026-07-07T00:06:59.129459Z","submitted_at":"2026-07-01T20:02:55Z","title":"FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-03T21:08:02.793814Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.01440"},"observation_digest":"sha256:0b9885676f16b57dd71375b84803c143473e7215494d8a669ca1050124f4d2ac","observation_id":"e23af757-cfea-49b7-a47a-ff1b4e5124e0","resolution":{"observed_at":"2026-07-03T21:08:57.478910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-07-11T09:29:31.521623Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05055","last_updated":"2026-07-06T13:29:07Z","snapshot_observed_at":"2026-07-11T09:29:31.032272Z","submitted_at":"2026-07-06T13:29:07Z","title":"Toward Trustworthy Large Language Model Agents in Healthcare","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T09:29:31.521623Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.05055"},"observation_digest":"sha256:ad7def46c91c830a596ea911c3caf4a63f28d5ca484213b29465900abf6c9619","observation_id":"292b8c9a-bbfd-4729-81a0-eeeca18aea4f","resolution":{"observed_at":"2026-07-11T09:29:31.521623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":"2311.16452","doi":"10.48550/arxiv.2311.16452","metadata_source":"pith","pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine","venue":"cs.CL","work_id":"db7034ec-f9ec-4e2d-a666-0b969db0fd67","year":2023},"citing_paper":{"arxiv_id":"2607.06157","last_updated":"2026-07-07T11:34:10Z","snapshot_observed_at":"2026-08-06T16:57:43.297582Z","submitted_at":"2026-07-07T11:34:10Z","title":"LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-08T15:03:14.483228Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.06157"},"observation_digest":"sha256:a6b06fb1365f0ffad2e996771e421d1d7125dc6248a104581edfa2c07e35387b","observation_id":"66436146-ad99-4c73-8af2-4dc13a4f617a","resolution":{"observed_at":"2026-07-08T15:05:03.512017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-01T14:16:01.779880Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18819","last_updated":"2026-07-21T07:55:07Z","snapshot_observed_at":"2026-08-06T23:55:01.270909Z","submitted_at":"2026-07-21T07:55:07Z","title":"In-Context Learning for Wound Classification with Small Multimodal Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T14:16:01.779880Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.18819"},"observation_digest":"sha256:54e5c8d7bb8d247b9489951e619193fbe64f54095c60acdb5a00bb13c1fe1949","observation_id":"aab801bd-2527-413d-9b33-3157153fa581","resolution":{"observed_at":"2026-08-01T14:16:01.779880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-02T13:38:11.801917Z","title":"Nori, et al., Can generalist foundation models outcompete special-purpose tuning? case study in medicine, arXiv preprint arXiv:2311.16452 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22555","last_updated":"2026-05-19T12:55:39Z","snapshot_observed_at":"2026-08-07T01:22:20.977020Z","submitted_at":"2026-05-19T12:55:39Z","title":"DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T13:38:11.801917Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.22555"},"observation_digest":"sha256:abe1b52acf5f44dbb12159ab9b3f03647fedac9611c1ec888ae50c7843c43b69","observation_id":"ea9593bb-f474-4e0e-9d9d-568a23ab9391","resolution":{"observed_at":"2026-08-02T13:38:11.801917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-01T02:21:20.359573Z","title":"arXiv preprint arXiv:2311.16452 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25485","last_updated":"2026-07-28T09:24:04Z","snapshot_observed_at":"2026-08-06T05:32:52.953547Z","submitted_at":"2026-07-28T09:24:04Z","title":"PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:20.359573Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2607.25485"},"observation_digest":"sha256:a749b52c24341355e7fc4923fbba18d7caadf2533b719221541bfa3222eb6fc6","observation_id":"39c08e43-e7f2-4c98-bf2b-6245d031a19a","resolution":{"observed_at":"2026-08-01T02:21:20.359573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.16452/citation-record","integrity":"/paper/2311.16452/integrity","json":"/paper/2311.16452/citation-record.json","paper":"/paper/2311.16452"},"outbound":[],"paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T08:26:36.845011Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2311.16452."}