{"as_of":"2026-08-18T17:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:895d55e79757810dad8b67bcf62f910d4863acaeaac1c4ea5ec421d328f66099","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:10:00.626842Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:52:45.867032Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08777","snapshot_observed_at":"2026-08-03T11:52:45.867032Z","title":"Yixin Wan, Arjun Subramonian, Anaelia Ovalle, Zongyu Lin, Ashima Suvarna, Christina Chance, Hritik Bansal, Rebecca Pattichis, and Kai-Wei Chang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04946","last_updated":"2026-06-01T13:55:11Z","snapshot_observed_at":"2026-08-09T12:03:17.550557Z","submitted_at":"2026-01-08T13:49:14Z","title":"Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T11:52:45.867032Z"},"links":{"cited_paper":"/paper/2509.08777","citing_paper":"/paper/2601.04946"},"observation_digest":"sha256:fd792c02dd6a21971742db88d87dc1b97a3a81921fa662c4e5bf8f3e629e3ec1","observation_id":"a9873766-246d-4eda-90e3-1c18aa61fda0","resolution":{"observed_at":"2026-08-03T11:52:45.867032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08777/citation-record","integrity":"/paper/2509.08777/integrity","json":"/paper/2509.08777/citation-record.json","paper":"/paper/2509.08777"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.685740Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"4c5e8d1a-390b-450d-a7e4-5689bb4f80e0","year":2016},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.156285Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:0d01fb72cb3e14e439e2eef89675e13a521d6178f1f145c0589795e46b2db5a0","observation_id":"b3608cf9-115f-4bf5-b4e5-07ebb093b7b4","resolution":{"observed_at":"2026-08-15T16:10:02.693800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.663823Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"30fb1299-27fc-4f58-a70d-18d10892269f","year":2015},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.166414Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:0e7af7c3c84b7ec7ada096192bddfa2a26c25140fe5d4a3de7801b06979e1e03","observation_id":"e6c8d3f1-6575-4cfb-8b47-53e70e1ee3fe","resolution":{"observed_at":"2026-08-15T16:10:02.670583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.643647Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els.arXiv, 2023","venue":null,"work_id":"623b77a6-c582-465f-996f-c578a193964c","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.173348Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:fd6bf8d80c9fbf7df25a881cd5bbdd59f0eeaed4cfb72269ed3dc52d88f440b7","observation_id":"6bd06c55-e959-4e66-a6be-e108851d6205","resolution":{"observed_at":"2026-08-15T16:10:02.650461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.622087Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv,","venue":null,"work_id":"db3a40b1-a648-4520-9c2b-9936ce388cf8","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.180401Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b6dbf395fbc7a99ca67e5212d842905bc942afba71d6697d18a9ede8b9c287ba","observation_id":"0f656ce2-34cf-4ab0-88f8-96953b6a04cf","resolution":{"observed_at":"2026-08-15T16:10:02.629248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.598729Z","title":"The control of the false discovery rate in multiple testing under dependency","venue":null,"work_id":"3bc9097b-f222-4b5d-8fac-27086844d62e","year":2001},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.187866Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:bad190f4c6b244365717e6c8ee096b000f1c5d712d152fdc41245e3e285cc6b0","observation_id":"296632bc-bb85-455f-925a-bb7ee389111d","resolution":{"observed_at":"2026-08-15T16:10:02.607339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.576167Z","title":"Improving image genera- tion with better captions.arXiv, 2023","venue":null,"work_id":"11254add-3063-4d81-bda6-cdd0a6f7a9ba","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.193866Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:bf153d826a3b9367ec2da2aebf22000587ff2acf07f28b9fb9d4dd8451c05451","observation_id":"c3889dd4-8ff4-4d03-ae37-b04576e9e4d5","resolution":{"observed_at":"2026-08-15T16:10:02.583340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.551471Z","title":"Visit-bench: A benchmark for vision- language instruction following inspired by real-world use","venue":null,"work_id":"aa707ec8-2ccc-4f93-92c8-128e1c5471b0","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.203766Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:144421680b44566432bd710a456211b940ac1cdf9f7b990f18e75c614270b9e8","observation_id":"72389f87-8d8c-4384-844c-f9a1c4df1373","resolution":{"observed_at":"2026-08-15T16:10:02.558709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.533128Z","title":null,"venue":null,"work_id":"46d8b525-b844-4fb2-8617-b36e6f6b7cf9","year":1997},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.214998Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:d536993953288b1c2875bbdbda1613afafeae3d11e5f811e2822bdab4efbd8a9","observation_id":"8f9e2392-17a6-4326-a0ae-d838dfc86f8d","resolution":{"observed_at":"2026-08-15T16:10:02.538394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.511970Z","title":null,"venue":null,"work_id":"1d4b0960-7e7e-40f0-9ba4-d85f9f0a639a","year":1950},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.223854Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:2fcd5e27c5bfea9ed86d196d07d92034e9bf6275665410de6b2873a14f33fb93","observation_id":"8f40a452-7d07-4743-8df3-d967181035f0","resolution":{"observed_at":"2026-08-15T16:10:02.517223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.494648Z","title":"X-iqe: explainable image quality evaluation for text-to-image generation with visual large language models.arXiv, 2023","venue":null,"work_id":"edcba21d-3d86-46d0-8fc2-314f258c39e8","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.236650Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:1b59003af8ab75af9e16a3c59836a8ca9fb8ccda3b66a4f90cf34a3de9886261","observation_id":"6bce0c68-48d2-4d24-9aa6-6c113d35c710","resolution":{"observed_at":"2026-08-15T16:10:02.499482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04842","last_updated":"2024-07-05T20:03:16Z","snapshot_observed_at":"2026-08-16T13:36:39.996892Z","submitted_at":"2024-07-05T20:03:16Z","title":"MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04842","snapshot_observed_at":"2026-08-15T16:10:00.244946Z","title":"Mj-bench: Is your multimodal reward model really a good judge for text-to- image generation?arXiv preprint arXiv:2407.04842, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.244946Z"},"links":{"cited_paper":"/paper/2407.04842","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:6cf78483672dc3b4680ca5f53d2eae6e4ca5cb2a93d890b255f5e41c9c377b06","observation_id":"cd27c001-1f68-470a-a1f1-bbc3fbfcdd66","resolution":{"observed_at":"2026-08-15T16:10:00.244946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.476429Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to- image generation models.ICCV, 2023","venue":null,"work_id":"c5fe5914-7f05-4a6a-93b7-d624c2a292fe","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.250740Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:83d47da507a7153425bdd699d5b6be7b899ff73248fd700f6fdc96e3d60e6c84","observation_id":"154966d0-46b3-4f1c-b0c8-985b62991e5a","resolution":{"observed_at":"2026-08-15T16:10:02.481840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.257632Z","title":"A coefficient of agreement for nominal scales","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.257632Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b5ba6e05155aa0ca70e34de39b0e897bdcd3181c88ab657967c0bfa43d9b68b9","observation_id":"c98be1fb-0aaa-4adc-b28f-389233eeb660","resolution":{"observed_at":"2026-08-15T16:10:00.257632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.447050Z","title":"Ex- ploring GPT-4 vision for text-to-image synthesis evaluation","venue":null,"work_id":"22d8dc9d-fd1b-4442-8680-73a450e15220","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.264208Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c770652358293571278a7441928bcc189e1c689580807cebf6399ef321193c1d","observation_id":"db31190b-3c9a-4b8d-83aa-5880698cb02a","resolution":{"observed_at":"2026-08-15T16:10:02.452085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.420258Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"4d98dcf7-69b7-48d0-b46e-00e95428b0c2","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.269383Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:39785c23874e39bc6b08f279fddfd473fb5743ce29e127d723071e3e9a7ab24a","observation_id":"4713f7d9-ba43-42c1-9b38-6cb3fab6fe3f","resolution":{"observed_at":"2026-08-15T16:10:02.432589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.386947Z","title":"Improving selective visual question answering by learning from your peers","venue":null,"work_id":"1ab74b90-2cf2-41c8-a765-0ac5079b3f39","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.275429Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:cc7ca3d272e82e94a9079865ad047f3e55179185058d904612b1b763c2fb6b1a","observation_id":"e9f98e67-98d7-424b-9c43-f51cbbc06d97","resolution":{"observed_at":"2026-08-15T16:10:02.395471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.359848Z","title":"Moura, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"69a4bf65-60bc-4249-bc02-487da48b724a","year":2017},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.280966Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:a7468d4ea9414211bb10cf47974fdf89d7efd819b573300babe702154323d2c2","observation_id":"2d64d8c7-47ba-4d50-916b-1859b72ac210","resolution":{"observed_at":"2026-08-15T16:10:02.366788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.329276Z","title":"The relationship be- tween precision-recall and ROC curves","venue":null,"work_id":"fcf9ef6d-fc13-490c-b6f3-28e714f9dc62","year":2006},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.286873Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:83c91c9e766d9d27bb5db646f0b5876521ec136e7fd8e1f1bd4fa0fc26263093","observation_id":"2fc28f98-7f8e-4b43-be9b-78b3ffc050c4","resolution":{"observed_at":"2026-08-15T16:10:02.339782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.303000Z","title":"Mllm-bench, evaluating multi- modal llms using gpt-4v.arXiv, 2023","venue":null,"work_id":"f4678f29-98c7-43fa-ac94-59c690ac93ce","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.292656Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b2878966b312d46dc7bd444ec4465a00930c1d011e83e1c495434c11fb99654d","observation_id":"c1a58c9a-e552-4a14-8230-cdfd66fb20ca","resolution":{"observed_at":"2026-08-15T16:10:02.308668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.268289Z","title":"Selective classification for deep neural networks.NeurIPS, 30, 2017","venue":null,"work_id":"0ce98b37-f8a4-48f0-bda1-2a267fe6f685","year":2017},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.297373Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:bd3afddb4eae30d5079d5c776b81b1a71e91bb7f0d3f7198883e11835f7d1e44","observation_id":"cf889458-d5e7-4a37-812d-ada0289494a3","resolution":{"observed_at":"2026-08-15T16:10:02.279222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.231956Z","title":"Practical variational inference for neural net- works.Advances in neural information processing systems, 24, 2011","venue":null,"work_id":"ea487503-62d4-4956-b249-f677e17a0bfa","year":2011},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.303656Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c7116698d1f1de33d8e08ec13b9d157a41b74bb2cac890dae9a1b79e6f1c28bc","observation_id":"3ac3fd95-a6bd-4817-a1f5-a02601c56ebf","resolution":{"observed_at":"2026-08-15T16:10:02.243263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T16:10:00.308515Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.308515Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:6fbcb745c690b2e22c5883cabc0696034265ffab946aaf88863ec9ded61de2cb","observation_id":"50ed7c0d-0e39-4e1c-89b7-341d31b53deb","resolution":{"observed_at":"2026-08-15T16:10:00.308515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.199874Z","title":"Weinberger","venue":null,"work_id":"84b3698c-abab-4298-996d-77a63c716419","year":2017},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.315283Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:e744e6364a341dd2734338d4861d0e144dfd885ecdbfbaa257d4750aae9e228f","observation_id":"0c043b7d-f93c-4c06-86aa-a88c76a3c2f3","resolution":{"observed_at":"2026-08-15T16:10:02.207848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.175987Z","title":"Springer, New York, NY , USA, 2001","venue":null,"work_id":"90c4b48f-67fc-4791-9f08-858cbd469772","year":2001},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.322231Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:0ecf66df1427a23a65f5c261979e1cfa644a0b53482ff9095b54f2b6cf395f48","observation_id":"d1968aae-65ba-443b-abce-e9e7212bf6af","resolution":{"observed_at":"2026-08-15T16:10:02.185588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.145807Z","title":"Glass, and Yulia Tsvetkov","venue":null,"work_id":"edb1b6d7-dc8f-41a9-95be-d2f9f073c682","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.327430Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:faa38755424a438f235d11e5d68b683c7c4e53daccd8525d54683f57b83ace48","observation_id":"961b2e05-ad1e-4d19-babe-1ef2bd9d6add","resolution":{"observed_at":"2026-08-15T16:10:02.153021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.106499Z","title":"Machine learning with a re- ject option: A survey.Machine Learning, pages 1–38, 2024","venue":null,"work_id":"a436d7f8-7745-43bf-9733-24a46ef17a29","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.333238Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b288c6f9e3d317c352c7c39b098224b0c9b7a90d189b7c739af0b08acd558650","observation_id":"50c20587-0fed-4899-9c3b-829f1045575b","resolution":{"observed_at":"2026-08-15T16:10:02.122870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:02.062004Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"c5e634d4-a1ac-4173-97fe-5f1d44607cf2","year":2017},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.338036Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b40087b1442d2ed8dedf2c403589c7635b5c3455785374ef4b43b27eab766cde","observation_id":"1535f5b7-42ce-4705-b41b-377cce914983","resolution":{"observed_at":"2026-08-15T16:10:02.072632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.807967Z","title":"Promptboosting: Black-box text classification with ten forward passes","venue":null,"work_id":"012c07bf-bd8e-4b20-a48e-a1493cec7ba6","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.342781Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:daad2bc7e27442d3f34a85a6dff3f9c1c430689d8a0a5804e0dd3fab90b06d67","observation_id":"4d1d5d0c-7ed4-4c99-a083-b21f4a11deb8","resolution":{"observed_at":"2026-08-15T16:10:01.822777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.785761Z","title":"Are llm-based evaluators con- fusing nlg quality criteria?arXiv, 2024","venue":null,"work_id":"cb98d125-67ff-404e-a603-dbe7dab2c08b","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.347986Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c01e67238c770d166d085cf1610f3bf371482fd6f31f6e7f5eb97c9f9876487e","observation_id":"ee14fb5c-be1b-4b8e-969a-4c5db627c4b7","resolution":{"observed_at":"2026-08-15T16:10:01.791347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T16:10:00.353769Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.353769Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:3ac6482cc8ced8d2e6e476960deb081e22720b8a088229356a1228d4fb27c0d2","observation_id":"1d2fd8af-c33a-46a9-ba26-84f3af4004ca","resolution":{"observed_at":"2026-08-15T16:10:00.353769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.765683Z","title":"Calibrating language models via augmented prompt ensembles.ICML Workshop on Deployable Generative AI, 2023","venue":null,"work_id":"c01b6037-3509-42ef-894a-6014cf313ee6","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.358862Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:477ed370e6c6a2face7fe6a17b3874a7915cb966631e5f01ea93c1b3e45fb4d8","observation_id":"630922ed-d7f5-43b2-a4ff-fc218f9e3f37","resolution":{"observed_at":"2026-08-15T16:10:01.772494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.749436Z","title":"How can we know what language models know?Trans- actions of the Association for Computational Linguistics, 8: 423–438, 2020","venue":null,"work_id":"7208f7dc-2c1f-4669-90d0-d062f7565379","year":2020},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.364453Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:4632741fae2b6d81d2e623f403250a4e25919fb86e105b4350af5fe8cd1ccba5","observation_id":"63b39703-7552-43eb-a441-c6312f9fc3f2","resolution":{"observed_at":"2026-08-15T16:10:01.753863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.369750Z","title":"Billion- scale similarity search with GPUs.IEEE Transactions on Big Data, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.369750Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:08d43d775fffc163f4d228e4d392c2e1f3ae17786a6911c9c235ba1e0113a274","observation_id":"4fcf8bfc-96e5-40bc-972c-0348b95f539c","resolution":{"observed_at":"2026-08-15T16:10:00.369750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-16T15:36:12.925339Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-15T16:10:00.375084Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.375084Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:ff694698f530cd6daf92eb805919a0b52b19d7c8d46e2411bad3d5caa1a68141","observation_id":"b5b565dc-d1de-4c51-9258-28f5acd50047","resolution":{"observed_at":"2026-08-15T16:10:00.375084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.715845Z","title":"Benchmarking cog- nitive biases in large language models as evaluators.arXiv,","venue":null,"work_id":"1c9ce536-2f5c-4e0a-bd36-f436d0435bb6","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.381149Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:7660c24b33eb49810e566f2746a1b53e165389fd473afeee928163d13e13ee38","observation_id":"dc03e82d-2585-4d28-8ac6-dfc2660a5cd1","resolution":{"observed_at":"2026-08-15T16:10:01.722060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.692079Z","title":"Improved precision and recall met- ric for assessing generative models.Advances in neural in- formation processing systems, 32, 2019","venue":null,"work_id":"e07a795c-aebf-4d37-8ed6-fbace2be0418","year":2019},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.386597Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c7379de620ae42e55fc0a33d7bc096a92f710fbf1986f4b84706dac9114c778d","observation_id":"6457c77b-21a7-4ee5-9e07-6bd84e102aa9","resolution":{"observed_at":"2026-08-15T16:10:01.698675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.675649Z","title":"Seed-bench: Bench- marking multimodal large language models.CVPR, 2024","venue":null,"work_id":"6b693371-6261-44ac-bf56-be39ed9cbc0f","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.392057Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:564636ce514be3a8c18abe3fd94afb764b950ecb63eb6dd7b13f00c942167f80","observation_id":"6730b91e-1eb6-47f2-9a98-f5c6c36a263e","resolution":{"observed_at":"2026-08-15T16:10:01.680752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.398173Z","title":"From generation to judgment: Op- portunities and challenges of llm-as-a-judge.arXiv preprint arXiv: 2411.16594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.398173Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:25407bdda0c96595ee610463b1ef596914b4b4acfbfd55146ee86203ef812a72","observation_id":"aacab920-6bf6-4e5b-856f-6e58fd94d9bb","resolution":{"observed_at":"2026-08-15T16:10:00.398173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-15T16:10:00.403033Z","title":"Llms-as-judges: a com- prehensive survey on llm-based evaluation methods.arXiv preprint arXiv:2412.05579, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.403033Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:5bfa6adb7e86f6d949a1f7004701bc05c8bb6fdbe97ce5eb02961213c5f51c1f","observation_id":"ed1813db-8738-4375-b8de-e443211a01e9","resolution":{"observed_at":"2026-08-15T16:10:00.403033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.658926Z","title":"ROUGE: A package for automatic evaluation of summaries.Text Summarization Branches Out, 2004","venue":null,"work_id":"09c9a1d7-2397-4321-81a6-08c1753c6fd2","year":2004},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.408036Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:80043995f7f4ab86d6d262ec3f7a1507afddcb2410a127e52631462a3810b23b","observation_id":"e6dc6f29-878c-4124-9224-42e5c027a030","resolution":{"observed_at":"2026-08-15T16:10:01.663637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.644559Z","title":"Microsoft coco: Common objects in context.ECCV,","venue":null,"work_id":"4f400e3b-71b2-434b-a221-d240329b9904","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.412807Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:1c757fd76a6bd524cd1528c896ab57bbdaf9174fdaea087482b089571d1d20c2","observation_id":"eedef4f5-10bf-4e1f-8883-18834e9609e5","resolution":{"observed_at":"2026-08-15T16:10:01.649144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.629927Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.ICLR,","venue":null,"work_id":"2daa9ccf-18eb-4a29-9be9-bd30cbe5c035","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.418416Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:4ba09ba6841c3e8d4f463154293b1e50736dd1398c3abe3eb7e47eeda7777195","observation_id":"34c4dde9-8ae8-4694-b073-83a8c2f1213a","resolution":{"observed_at":"2026-08-15T16:10:01.634648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.611367Z","title":"Visual instruction tuning.NeurIPS, 2023","venue":null,"work_id":"2fb78782-72bd-48a8-b057-09a92a380209","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.424190Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:34726fed459b1a78a4f9cbea6c1956fb9787597bcc3a270410d8d822e074fed6","observation_id":"1f9f3cc8-6c8c-4959-9956-418a5551f759","resolution":{"observed_at":"2026-08-15T16:10:01.616525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.594900Z","title":"Llms as narcissistic evaluators: When ego inflates evaluation scores","venue":null,"work_id":"1c9ca657-02f7-4a11-8d15-fe2406e457cd","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.429547Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:fe969e5988a6d80b6f1b3281f134e51ed5b4c90255223f6e767c15ae304d0057","observation_id":"08920eaf-a063-4fbd-b6dd-bdec8601d243","resolution":{"observed_at":"2026-08-15T16:10:01.599673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.578762Z","title":"Predict re- sponsibly: improving fairness and accuracy by learning to defer.NeurIPS, 31, 2018","venue":null,"work_id":"08b3bd77-5d11-4782-b550-38e246bdda8b","year":2018},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.437345Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:51a8766ffa457f5f0224ed8d33568c0420068ffaebaae6db09cba78f0382f374","observation_id":"79738d18-7d1f-4dda-b52b-0a6dc496f15a","resolution":{"observed_at":"2026-08-15T16:10:01.583978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.561230Z","title":"Gpt-4v(ision) technical work and authors.https: //openai.com/contributions/gpt-4v/, 2023","venue":null,"work_id":"a95a7076-8e47-45ad-b428-51e7b0d8f62d","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.447853Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c8d8959101c577d16af085e22396acfcb84b9500e0c4ebabe01d7fc3fccddd5c","observation_id":"ff6be8c5-c650-4e3d-8f34-aa2d59ad8fbb","resolution":{"observed_at":"2026-08-15T16:10:01.567076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.542926Z","title":"Openai o1 system card.https://openai","venue":null,"work_id":"cbf299a0-a549-45b9-b69d-275d9a876e54","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.454060Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:e24d98b44fac431731508fa1d8e75ce1b8db4bdc14050e27c6b4ed431c5dd9fb","observation_id":"18587033-0c7e-4bae-b88d-3b52140a17ad","resolution":{"observed_at":"2026-08-15T16:10:01.548783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.525002Z","title":"Bowman, and Shi Feng","venue":null,"work_id":"e599c270-09e4-49e4-a383-67165ac98118","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.459708Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:d6237fd7437e9fddf21c6ea912bdad2b80b95fcc026691998abf14ec2684a942","observation_id":"81130e22-1f21-4b9b-9d3b-0b945da0266e","resolution":{"observed_at":"2026-08-15T16:10:01.529864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.507911Z","title":"Bleu: a method for automatic evaluation of machine translation.ACL, 2002","venue":null,"work_id":"97d402b3-81d0-4af5-a241-16018369e35b","year":2002},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.465601Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:fd5e0520130c202faa2044a2ae0c28b04f58f45398ec605beb53b129cd8e674b","observation_id":"29d9ffa6-db7a-46ab-a660-9fa37b651757","resolution":{"observed_at":"2026-08-15T16:10:01.513432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.491371Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv, 2023","venue":null,"work_id":"fca37b7f-e4e9-43df-b133-3cad13fc2050","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.470734Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:c005dbdc8914ef6eadbf9f6147624eee446f0f66bb2143c3450aba199bbad4d8","observation_id":"a6302416-04e4-41e4-94bd-df1e4bafa69a","resolution":{"observed_at":"2026-08-15T16:10:01.496197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.475886Z","title":"Sdxl: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"38a631ca-2e3a-4801-a9f5-3b0f2f678a34","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.479329Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:2a8b492818aac086257f106e5c30f00ffd274c5fd62fbaf7db25d16617d4ec38","observation_id":"9fe06e04-fb45-4444-b18f-cc46b54d7cbb","resolution":{"observed_at":"2026-08-15T16:10:01.480822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.461264Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"13de2ede-facd-4272-a57d-43d486713e1f","year":2021},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.485703Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:6a15c229830023f4ac410589fdfdddd3f4e4819a49a09797e0a6e99e6d33a35c","observation_id":"a6642fe0-938a-4e65-b5af-5f2aa834ca84","resolution":{"observed_at":"2026-08-15T16:10:01.465835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.491246Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.491246Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:791c84c15bb074d32d11504be49816070562d1ceca746fe48c3e6bf1ac94b17f","observation_id":"dd110cf1-eb76-4eb6-ac18-88681c72771d","resolution":{"observed_at":"2026-08-15T16:10:00.491246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.497977Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.497977Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:5aba2dec1867b595a47d3264866af5ecd7b0eda5b1d5cd9a6ca07bd92192c030","observation_id":"acda0efd-f74e-452c-b6a4-2b9bf2eef5b0","resolution":{"observed_at":"2026-08-15T16:10:00.497977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.504942Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.504942Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:55316fc015c7606fef2aeeab1cc86aee09aa5d0b72e7cb9d0a5901dc58ef0834","observation_id":"8c673ea0-015c-43c3-9ff1-55243a793312","resolution":{"observed_at":"2026-08-15T16:10:00.504942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10076","last_updated":"2023-10-16T05:19:02Z","snapshot_observed_at":"2026-08-16T14:51:54.448036Z","submitted_at":"2023-10-16T05:19:02Z","title":"Verbosity Bias in Preference Labeling by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10076","snapshot_observed_at":"2026-08-15T16:10:00.510105Z","title":"Verbosity bias in preference labeling by large language models.arXiv preprint arXiv:2310.10076, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.510105Z"},"links":{"cited_paper":"/paper/2310.10076","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:5a437e353c03eabed41f062a6197e6a9e13ef2282cf413d6d2d331140ce178ba","observation_id":"bd90b93e-f9d4-49d2-9b90-d0c73c5af6e5","resolution":{"observed_at":"2026-08-15T16:10:00.510105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:00.516193Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.516193Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:94aad88a93217c57383195ed6d03b721fdfe9964e039dccafb70a6110b09ec55","observation_id":"6f718aff-0726-4723-83f1-39f0762985ac","resolution":{"observed_at":"2026-08-15T16:10:00.516193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T16:10:00.522704Z","title":"Gemini: a 10 family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.522704Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:8499bb401912b1b0db1ae35f3f21187848dacac10afa01b5918671e9e8e761eb","observation_id":"74a7356c-e99d-486f-9520-91e1f63a4e2f","resolution":{"observed_at":"2026-08-15T16:10:00.522704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.403810Z","title":"Bayesian prompt ensembles: Model uncer- tainty estimation for black-box large language models","venue":null,"work_id":"c1918a1d-3dbc-45c3-85fa-060d7f5135e6","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.528704Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:eea7ded56a5d912d217ba4c409a4dbc587d0a858ba85477725ff9633d2e2aeb1","observation_id":"2dac2553-0751-4480-9372-0f948155de8d","resolution":{"observed_at":"2026-08-15T16:10:01.411155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.358378Z","title":"Large language models are not fair evaluators.arXiv, 2023","venue":null,"work_id":"a9768eff-8476-4b30-84c4-b7b40be29b58","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.535789Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:3f0202879beed0bdc36a416ef30d3f1f485ba50bd62c1e0dc9b15c88367f737b","observation_id":"05aab997-1bb7-4874-83e8-5beefa44aae4","resolution":{"observed_at":"2026-08-15T16:10:01.364011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-15T16:10:00.541896Z","title":"A prompt pattern catalog to enhance prompt engineering with chatgpt.arXiv preprint arXiv:2302.11382, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.541896Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:df1c13e028f0964e67f3dbaf5fc4c09238f389ac21d0cf8b29e292a34946accf","observation_id":"2312aa86-2571-4756-85a9-3ac0906d2d99","resolution":{"observed_at":"2026-08-15T16:10:00.541896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.340793Z","title":"Reliable visual question answering: Abstain rather than answer incorrectly","venue":null,"work_id":"fb753117-0d8e-403c-9258-191e4173b219","year":2022},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.548729Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:2e8e54d4dec163b7694265efac469c915d9294d5b037ac23fe2ee2b8348a4e33","observation_id":"46695519-4fe1-4fdf-bb09-bbff6705d6a6","resolution":{"observed_at":"2026-08-15T16:10:01.347422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.324075Z","title":"Strength in numbers: Estimating confidence of large language models by prompt agreement","venue":null,"work_id":"77537d02-74c4-4d28-b74b-ed13837953f9","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.553882Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:9489fc3ee936d71eefaa757353fc9fdd2a2f7d26c24c89b9ca7895563762d8ec","observation_id":"2790cf08-e40c-488b-ad53-ccdbcdb1149c","resolution":{"observed_at":"2026-08-15T16:10:01.329704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.304346Z","title":"Gpt- 4v(ision) is a human-aligned evaluator for text-to-3d genera- tion.CVPR, 2024","venue":null,"work_id":"16b4c0bc-409f-4528-91ad-b090bf126292","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.560479Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:5a7b741a42d575a5bb9d2248bfd7eedf853e497c77ed9587ed0808e43055f80a","observation_id":"bac3ba20-eb94-4ada-8c22-672fa9814ea6","resolution":{"observed_at":"2026-08-15T16:10:01.310636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-15T16:10:00.568962Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.568962Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:b231819bd1ebad80faec6e08ac9b1a31e9a654eb8e1e99b52919dfeeffc63259","observation_id":"040f3b76-5409-42df-a13f-ef97dae5b022","resolution":{"observed_at":"2026-08-15T16:10:00.568962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-16T13:12:52.288371Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-15T16:10:00.575267Z","title":"Llava- critic: Learning to evaluate multimodal models.arXiv preprint arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.575267Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:66a23265016b03a8d6bcb4d9ab19df59803b12d992302013eac3112bc7dbc246","observation_id":"ed5d8eb4-7abe-4a9a-a27a-5c59e2c77edf","resolution":{"observed_at":"2026-08-15T16:10:00.575267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.284385Z","title":"Vigor: Improving visual ground- ing of large vision language models with fine-grained reward modeling.arXiv, 2024","venue":null,"work_id":"0f0880ce-23a4-4bcb-a1a1-8bcd0500d604","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.580346Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:46151057012a64eb81270705b4472704f8443449ff5e0b6f95ed6a2e3220fc99","observation_id":"d18d541b-1b04-44b3-b11c-a8c401a50f3b","resolution":{"observed_at":"2026-08-15T16:10:01.293121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-15T16:10:00.585677Z","title":"Jus- tice or prejudice? quantifying biases in llm-as-a-judge.arXiv preprint arXiv:2410.02736, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.585677Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:25d9240896fa2fb390505b60f029e57884fd72973fd770c170ddbb699a593fcf","observation_id":"86a15652-b7a6-47e4-abb7-6685669a3438","resolution":{"observed_at":"2026-08-15T16:10:00.585677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.182326Z","title":"Lamm: Language-assisted multi- modal instruction-tuning dataset, framework, and bench- mark.NeurIPS, Datasets and Benchmarks, 2023","venue":null,"work_id":"cf6ec8e5-4f21-4b6e-ac93-355c96df90b8","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.591692Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:82887a738938b550dea0ddd5d7ba1b2db417451a90cb7306471b931b18dbacc0","observation_id":"69b50544-9ab8-47d9-84b5-a70d76dc94b0","resolution":{"observed_at":"2026-08-15T16:10:01.215242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.165418Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions.TACL, 2014","venue":null,"work_id":"38d5b107-989c-4bdc-bdf5-b5c634858a0a","year":2014},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.596836Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:822307913b3f1dd6823b6e9964e71df3c7667fbeed481cb10d9055fc33cca80a","observation_id":"890b33c7-a2e6-4119-a72a-ecfe12e73217","resolution":{"observed_at":"2026-08-15T16:10:01.170686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.146954Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.ICLR, 2024","venue":null,"work_id":"f39660d4-9f87-4200-8b2b-3e17a7842018","year":2024},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.601866Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:2830669f2be89f2085e7e90b8fbd66bf2c2db31212488265ab499e78854c41a6","observation_id":"361b64b5-0a25-4096-baf4-c940b3ce35c1","resolution":{"observed_at":"2026-08-15T16:10:01.151904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.129865Z","title":"Gpt-4v (ision) as a generalist eval- uator for vision-language tasks.arXiv, 2023","venue":null,"work_id":"6e6569b9-e1d6-4e15-b445-9eb720a39b44","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.608245Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:312c549e3d6429a7324c220386f43498615fc3abd5c0c7119146735caaa7a65b","observation_id":"cf8ea24a-ae78-4a0f-bbff-491f68b5e0ff","resolution":{"observed_at":"2026-08-15T16:10:01.135983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.107184Z","title":"Xing, Haotong Zhang, Joseph Gon- zalez, and Ion Stoica","venue":null,"work_id":"a1ece52b-a970-4fe7-bc5b-0d220d69b1c8","year":2023},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.614297Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:4c994345e969f1be524ccc657f386b254fa3957f896792bd39e92a879d4695ba","observation_id":"4fff451b-3ad9-4207-ad5a-611a9e740573","resolution":{"observed_at":"2026-08-15T16:10:01.114231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.088862Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.ICLR,","venue":null,"work_id":"2bfb184f-e916-4431-8b2a-53762079a1fa","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.621266Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:392033d464d7c0842d0eff3ed89870cfcde6b5abf2a88a4cb261b1048fc7da09","observation_id":"a3119628-c4d5-446c-bd6b-21d8f795f5f7","resolution":{"observed_at":"2026-08-15T16:10:01.094516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:01.070800Z","title":"aug- mented","venue":null,"work_id":"f27572d8-84e5-418f-81fd-1b33868940f9","year":null},"citing_paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:00.626842Z"},"links":{"citing_paper":"/paper/2509.08777"},"observation_digest":"sha256:54e2527c716d05bf0536b8ac7df8d9076e13a50d827d7fceae2fc1d8f58b2a8e","observation_id":"a9d90768-44cc-4730-ac0b-4e6b611cee8a","resolution":{"observed_at":"2026-08-15T16:10:01.077119Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08777","last_updated":"2025-09-10T17:06:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:06:30.436859Z","submitted_at":"2025-09-10T17:06:47Z","title":"Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 1 inbound Pith citation observation for arXiv:2509.08777."}