{"as_of":"2026-08-13T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d496e10bea23dab62f2d5d645ce84c84f0e091a90d83c91e9f045992c939fc7","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:03:39.123887Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24492/citation-record","integrity":"/paper/2605.24492/integrity","json":"/paper/2605.24492/citation-record.json","paper":"/paper/2605.24492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:c3878d67d090cbb2c5bbd5a0be5ef131edf5468718f8abbefd8eac472989086d","observation_id":"a48e7783-cc04-45f6-9bc4-267c56cd46d5","resolution":{"observed_at":"2026-06-30T14:04:44.348547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00056","last_updated":"2024-11-24T17:49:48Z","snapshot_observed_at":"2026-08-12T13:41:06.623009Z","submitted_at":"2024-11-24T17:49:48Z","title":"Improving Medical Diagnostics with Vision-Language Models: Convex Hull-Based Uncertainty Analysis","version":1},"cited_work":{"arxiv_id":"2412.00056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00056","snapshot_observed_at":"2026-06-30T14:04:44.349649Z","title":"Junying Chen, Chi Gui, Ruyi Ouyang, Anningzhe Gao, Shunian Chen, Guiming Hardy Chen, Xidong Wang, Ruifei Zhang, Zhenyang Cai, Ke Ji, and 1 others","venue":null,"work_id":"344231ef-d45d-46a3-b6b7-99db66dd59b8","year":2025},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2412.00056","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:ee81e269235b06ee2ad128661a0a62d199291d65cdac4cc28b1437d45bb493e5","observation_id":"be4187e3-61d1-41e6-8bab-277e8ed0366d","resolution":{"observed_at":"2026-06-30T14:04:44.351117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:25a3e5dbba8012cbce5736e28ea3583e809f0e605de30168680c27fc3ae21165","observation_id":"9dfe3684-2199-44ef-981e-41c8ea065f9d","resolution":{"observed_at":"2026-06-30T14:04:44.345634Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:46:57.312565Z","title":"Multimedeval: A benchmark and a toolkit for evaluating medical vision-language models","venue":null,"work_id":"34530e5d-912c-4eac-b75f-481f629c520e","year":2024},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:b40640e78dac82cbd2105c563baf68c3831abf196554accc3a07f06307dd7077","observation_id":"f342570b-7945-4509-984e-ffffe6e21637","resolution":{"observed_at":"2026-06-30T14:04:44.336551Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"cited_work":{"arxiv_id":"2404.18416","doi":"10.48550/arxiv.2404.18416","metadata_source":"pith","pith_arxiv_id":"2404.18416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Capabilities of Gemini Models in Medicine","venue":"cs.AI","work_id":"27822395-fb36-4417-a4f3-f0a1f801ac20","year":2024},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2404.18416","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:cf42a37d19ddba1b5d471111485dca57d5513972bc73d776281526d5417c5d45","observation_id":"5fdc7609-8382-4ad9-bb0d-246ebd0ad317","resolution":{"observed_at":"2026-06-30T14:04:44.342060Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11969","last_updated":"2023-11-20T17:59:03Z","snapshot_observed_at":"2026-08-13T05:21:03.299413Z","submitted_at":"2023-11-20T17:59:03Z","title":"SA-Med2D-20M Dataset: Segment Anything in 2D Medical Imaging with 20 Million masks","version":1},"cited_work":{"arxiv_id":"2311.11969","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11969","snapshot_observed_at":"2026-07-02T13:16:58.492036Z","title":"Sa-med2d-20m dataset: Segment anything in 2d medical imaging with 20 million masks.arXiv preprint arXiv:2311.11969,","venue":null,"work_id":"2545a9ae-1a0f-4232-9077-a605381f7b4d","year":2025},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2311.11969","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:e9cc98fe1255d0a0e66cf0bcba96cad037f530d042349f91b03697a84df40f9c","observation_id":"0e38be63-c7b5-47bc-be97-804ce4099213","resolution":{"observed_at":"2026-06-30T14:04:44.350657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24173","last_updated":"2025-05-30T03:33:25Z","snapshot_observed_at":"2026-08-12T15:24:28.341946Z","submitted_at":"2025-05-30T03:33:25Z","title":"DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?","version":1},"cited_work":{"arxiv_id":"2505.24173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24173","snapshot_observed_at":"2026-06-30T14:04:44.341758Z","title":"arXiv preprint arXiv:2505.24173 , year=","venue":null,"work_id":"e2573ae3-0ebf-4f72-898d-b01008551cb5","year":2025},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"cited_paper":"/paper/2505.24173","citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:4a778eeccde9b864d487934a9cf1524696887f583ff71e400938d38651158390","observation_id":"6c6facfa-4dfc-401d-bc81-b39660666d81","resolution":{"observed_at":"2026-06-30T14:04:44.343130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:43.958681Z","title":null,"venue":null,"work_id":"cdbda5c2-1c19-4e9d-8592-42520c0f94e5","year":null},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:5fec4b7ea063a579ae2b7612a7602ea04ce4d12e739e3be91688e89422fe5b7d","observation_id":"4fb0c62a-fc65-48d6-a0fc-945407c4c1e8","resolution":{"observed_at":"2026-07-08T23:55:43.959720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:43.957048Z","title":null,"venue":null,"work_id":"6f389616-6a42-46e8-89b6-c9988ee265a7","year":null},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:bd996e72f0219af366d62656ae4db8866e5450e0375dc9dc211bf2e41f4ec283","observation_id":"457497f2-3f41-40a7-9da1-4e2efe73d191","resolution":{"observed_at":"2026-07-08T23:55:43.958146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:43.952583Z","title":null,"venue":null,"work_id":"4973621d-390c-461b-a049-6d03261a6a5e","year":null},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:cf2fc476d514ff0486cba6a900a9b40d1e92d547de5be634c23a8492e8021d7e","observation_id":"a3820aa5-7de8-4e3c-b809-790acdb10af0","resolution":{"observed_at":"2026-07-08T23:55:43.953930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:43.954620Z","title":"no lung opacity","venue":null,"work_id":"5a1bbc58-2f30-40f9-a67f-02e723a70bd6","year":null},"citing_paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T14:03:39.123887Z"},"links":{"citing_paper":"/paper/2605.24492"},"observation_digest":"sha256:9c381289c35b7ce327d2df5e6d104e29e8ce56fd6509a82f36664e8fc8db28c9","observation_id":"a160af29-9aec-4f1b-8c58-2b6dd3e64484","resolution":{"observed_at":"2026-07-08T23:55:43.955907Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24492","last_updated":"2026-05-23T09:50:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T08:34:24.162523Z","submitted_at":"2026-05-23T09:50:19Z","title":"Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2605.24492."}