{"as_of":"2026-08-12T13:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea10289f504e569aea1f98e7a81c47127bd37d8af73723453b8ad4db682f7340","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:21:57.784836Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21430/citation-record","integrity":"/paper/2508.21430/integrity","json":"/paper/2508.21430/citation-record.json","paper":"/paper/2508.21430"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:01.156633Z","title":null,"venue":null,"work_id":"4821de27-c681-4eee-9923-4ae146540941","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.261839Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:0f65dae5cc0d9d5f90b0744f97bc54b1008d858461c11c557b91a35b12201640","observation_id":"38e85c1a-bdd7-4236-85b9-cbcae452f34a","resolution":{"observed_at":"2026-08-05T14:22:01.190651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:01.084753Z","title":null,"venue":null,"work_id":"c3ab0aad-43fa-48af-81ed-6deae751caa9","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.454192Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:a188ea0c19caabda7f501c87ffaf80f72ec33c566d15367be43c77c9fab93ab1","observation_id":"c319738c-c5eb-41f6-af4c-93a91875a08b","resolution":{"observed_at":"2026-08-05T14:22:01.105368Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.949531Z","title":null,"venue":null,"work_id":"3412e54e-bbdf-4f6a-8b55-82b736221018","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.614861Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:6d7b9509fd111f9d621e86295343266d3241d72bdf34f904cf1c2ed30a691fc8","observation_id":"776a21ff-b22c-4a04-8626-15bd2e718400","resolution":{"observed_at":"2026-08-05T14:22:00.994829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.790780Z","title":null,"venue":null,"work_id":"e250c94f-5adf-4d62-aa03-3232b79965ab","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.710845Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:bc9876e74e2e2ae32e1b0cbd329d287fceae7484621fa4f5ba53d7e391c5175d","observation_id":"67f35a9b-fae1-42e3-9332-c2d97c799206","resolution":{"observed_at":"2026-08-05T14:22:00.834749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.671573Z","title":null,"venue":null,"work_id":"5545b61f-70bb-4f03-baf1-78b9a33b04f5","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.844756Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:2098755a8393054b3f0116b47d0cb62ea75d08ada62802c16b569f89093b371b","observation_id":"9d13ea83-753d-468b-896d-04d4127abcf0","resolution":{"observed_at":"2026-08-05T14:22:00.704757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17578","last_updated":"2025-03-29T11:50:10Z","snapshot_observed_at":"2026-07-06T19:38:13.816410Z","submitted_at":"2024-10-23T06:04:55Z","title":"MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17578","snapshot_observed_at":"2026-08-05T14:21:55.894317Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition, pages 13183–13192","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.894317Z"},"links":{"cited_paper":"/paper/2410.17578","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:9fe22aeb768644640c5b9dc5f8282f77f27c5d10fb31a54def6dad239fa56c10","observation_id":"80d65daf-bf30-4c19-a3bb-6c5f5417cd2a","resolution":{"observed_at":"2026-08-05T14:21:55.894317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T14:21:55.973546Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.973546Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:cc1d30546e86689f17834886729da31361b53dd2d02b5cea2fa83a6e3572d54b","observation_id":"da040793-6afc-4da9-a976-96a115cf4ac3","resolution":{"observed_at":"2026-08-05T14:21:55.973546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15253","last_updated":"2025-05-21T23:42:20Z","snapshot_observed_at":"2026-08-12T02:54:44.090760Z","submitted_at":"2025-04-21T17:33:23Z","title":"Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15253","snapshot_observed_at":"2026-08-05T14:21:56.146103Z","title":"In Proceedings of the 62nd Annual Meeting of the Association for Compu- tational Linguistics (Volume 3: System Demonstra- tions), Bangkok, Thailand","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.146103Z"},"links":{"cited_paper":"/paper/2504.15253","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:7a5feed84bdb8749996cc9f7e7ba75b6e9f91c461b8d07b6349e8d91674721ba","observation_id":"aa498442-b8c9-46d0-9379-96303932e058","resolution":{"observed_at":"2026-08-05T14:21:56.146103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.545314Z","title":"Avoid any position biases and ensure that the order in which the responses were presented does not influence your decision","venue":null,"work_id":"8dc1bc2a-007d-4199-ad0c-1f391f7b49a0","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:56.957220Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:1c0f8addb0027536f94803c80c8bd295df78425241a7a96557e482030c068d35","observation_id":"548f9eee-b684-45d2-80d9-790aefc92624","resolution":{"observed_at":"2026-08-05T14:22:00.585461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.374759Z","title":"immediate PET-CT for a suspected pulmonary nodule,","venue":null,"work_id":"d5875952-e123-41cb-b0dd-30e775be36db","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.040837Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:793ba08ea4c0281741f94d98656763d9dd420f1fca8e7a07bdd43ec691a16d3d","observation_id":"ecf46c95-0526-423c-bcef-c21d657f7c6f","resolution":{"observed_at":"2026-08-05T14:22:00.434624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.173728Z","title":null,"venue":null,"work_id":"4487b3c3-1677-4e7a-a876-e2647e2911a3","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.212535Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:b58adc2ad10266a88a57f0248353210f74cf1f143f5f4210ac3e78fd044258a5","observation_id":"aba0a1e2-a3c7-44fd-9f42-d2956b6cc78f","resolution":{"observed_at":"2026-08-05T14:22:00.224753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:00.003210Z","title":null,"venue":null,"work_id":"2f39cb9f-87f2-40a1-bbe1-e506e644bae8","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.326352Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:0003e011e1c3c642315fcc266df855299a0fea7fae4be2c88efb04069e631e2b","observation_id":"2bcceeaf-4caa-4493-97e0-180d924d1cab","resolution":{"observed_at":"2026-08-05T14:22:00.044919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:59.854860Z","title":null,"venue":null,"work_id":"452a8942-afc1-449b-9c10-017445eca747","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.444933Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:235af9e59389e0bebf239a3d9f5d39d2fa6632c9c260b6e41bcd8c8093ccfd79","observation_id":"79d69425-8446-4115-b84c-99b5157d7159","resolution":{"observed_at":"2026-08-05T14:21:59.914761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:59.704495Z","title":"The most likely cause is... I recommend","venue":null,"work_id":"dde885d1-8cfe-407d-8776-d8c74710c638","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.596334Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:8cf3d33bfee65972380603b0666cd284e466b23c7657152fae714e4d587cb5de","observation_id":"d3b7a27a-046c-480a-a762-fbfb440a9ae0","resolution":{"observed_at":"2026-08-05T14:21:59.734747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:59.544748Z","title":"Additional Notes - All medical images are de-identified from real clinical cases","venue":null,"work_id":"0545eaf8-2a03-4bb0-afb8-f0ad050181a5","year":null},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:57.784836Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:235759dd7fa08541ded7123b3fb5abe9a1b2e714d6fcf982820b6800cf93a3fa","observation_id":"6e29a972-f3a3-461c-a627-10b8fdb0f1e4","resolution":{"observed_at":"2026-08-05T14:21:59.604755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.15925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:21:58.785523Z","title":"Fenglin Liu, Tingting Zhu, Xian Wu, Bang Yang, Chenyu You, Chenyang Wang, Lei Lu, Zhangdai- hong Liu, Yefeng Zheng, Xu Sun, et al","venue":null,"work_id":"70d34663-f39e-43f6-9016-eded9f145e41","year":2023},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":1654,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.651594Z"},"links":{"citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:2b6ec120018d766536c97d983257ed42eead977cead21d7030273ec23d5bf2b5","observation_id":"527bb06d-1583-48f6-a375-a6a5466e66eb","resolution":{"observed_at":"2026-08-05T14:21:59.131160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17489","last_updated":"2025-03-21T18:59:20Z","snapshot_observed_at":"2026-08-12T07:35:18.990650Z","submitted_at":"2025-03-21T18:59:20Z","title":"Judge Anything: MLLM as a Judge Across Any Modality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17489","snapshot_observed_at":"2026-08-05T14:21:55.725194Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.725194Z"},"links":{"cited_paper":"/paper/2503.17489","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:1eddfb7cb1cb68ed88c545ca2219d72b49b12cc07443c3da7bb8df34ed861405","observation_id":"33c3338e-64c2-4b7c-a62f-2420b1d25284","resolution":{"observed_at":"2026-08-05T14:21:55.725194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07478","last_updated":"2025-03-10T15:52:57Z","snapshot_observed_at":"2026-08-07T17:16:17.921406Z","submitted_at":"2025-03-10T15:52:57Z","title":"VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07478","snapshot_observed_at":"2026-08-05T14:21:55.825705Z","title":"Advances in Neural Information Processing Systems, 36:53728– 53741","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.825705Z"},"links":{"cited_paper":"/paper/2503.07478","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:597f137dc7b76c85aa564701472fc6e53487996cbed3d6c0eda9bcf10305a79e","observation_id":"f89be8b3-0511-4bd6-85c4-d878df93c4c4","resolution":{"observed_at":"2026-08-05T14:21:55.825705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15127","last_updated":"2024-11-04T15:54:21Z","snapshot_observed_at":"2026-07-06T18:04:26.177088Z","submitted_at":"2024-04-23T15:27:19Z","title":"GSCo: Towards Generalizable AI in Medicine via Generalist-Specialist Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15127","snapshot_observed_at":"2026-08-05T14:21:55.534892Z","title":"arXiv preprint arXiv:2404.15127","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.534892Z"},"links":{"cited_paper":"/paper/2404.15127","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:a59899b9bb9d481b0758443ebac5a8010f648575bf6d5ea801131c3882c107d2","observation_id":"ce46be49-8ef7-4a6a-b82b-5cca7ba006c3","resolution":{"observed_at":"2026-08-05T14:21:55.534892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T14:21:55.432245Z","title":"arXiv preprint arXiv:2502.13923","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:55.432245Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.21430"},"observation_digest":"sha256:f09b6867d92799e0139dc518ebe538fd47803488276a67dbb8e3605d4847e4ab","observation_id":"776d64b9-c31a-422a-b910-27d5a4a555fc","resolution":{"observed_at":"2026-08-05T14:21:55.432245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.21430","last_updated":"2025-08-29T08:58:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T05:40:33.062754Z","submitted_at":"2025-08-29T08:58:39Z","title":"Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2508.21430."}