{"as_of":"2026-08-12T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e69435cd1a2074a359e90bd7e7f215da9bad48126425fbf5171f5949f8077e0","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:52:20.853170Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T00:53:35.188721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:36:26.482689Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"cited_work":{"arxiv_id":"2412.10594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards unified benchmark and models for multi-modal perceptual metrics","venue":null,"work_id":"44db19c0-5596-4c46-9426-ea9fbf146b8b","year":2024},"citing_paper":{"arxiv_id":"2605.08412","last_updated":"2026-05-08T19:20:23Z","snapshot_observed_at":"2026-08-11T03:42:28.649347Z","submitted_at":"2026-05-08T19:20:23Z","title":"SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T00:53:35.188721Z"},"links":{"cited_paper":"/paper/2412.10594","citing_paper":"/paper/2605.08412"},"observation_digest":"sha256:ba19a744c7768204a09ac48e09a9f7f42edbb418c13be7ab1b838a2a2eb193d7","observation_id":"199e40c4-055f-4d48-bd48-e116c72c03bf","resolution":{"observed_at":"2026-05-12T08:36:26.485902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10594/citation-record","integrity":"/paper/2412.10594/integrity","json":"/paper/2412.10594/citation-record.json","paper":"/paper/2412.10594"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T15:52:20.513627Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.513627Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:55b370e53ac63fa666e1d6a510314dea0401e3f565581ecc23f081d0e3752551","observation_id":"17c76d01-0a43-4413-9ca1-1c11c3c02838","resolution":{"observed_at":"2026-08-11T15:52:20.513627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:22.021608Z","title":"Getting vit in shape: Scaling laws for compute-optimal model design","venue":null,"work_id":"800598b1-76ef-40e4-9fe3-9bbebb3aec53","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.519143Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:0a2704d9df28d6459059762bd1fae13b5c8368d1c9f6f70ea5301c6b1ec8a5fc","observation_id":"8a9ada32-5c20-4329-ae7a-bb6c736e9d9f","resolution":{"observed_at":"2026-08-11T15:52:22.028682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:20.524263Z","title":"Improving image captioning descriptive- ness by ranking and llm-based fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.524263Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:69c65113871561216a7554e631108613737a495a57d2ef5cca468262a862f842","observation_id":"fcbf14c3-cec0-4f98-9c87-b6bc37f76105","resolution":{"observed_at":"2026-08-11T15:52:20.524263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:20.528675Z","title":"Learning a deep single image contrast enhancer from multi-exposure images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.528675Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:d51322ce9d3876f847a95537ac23df703beeb99e77402a883f099e6f954f5951","observation_id":"c51dfb68-7948-473f-9ac6-d97d834435e5","resolution":{"observed_at":"2026-08-11T15:52:20.528675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.982832Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"f677edb2-2bdf-4202-bc1c-e424ac649161","year":2021},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.532907Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:18efdeea6a752bbf1ad8a1952aa290dce66e0ac05cdc62f5a071b1a5805aeb38","observation_id":"77e17d57-450e-4094-9598-a01932b70e4d","resolution":{"observed_at":"2026-08-11T15:52:21.991793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:20.537679Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.537679Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:890cf788c6f3df3229cbe507665c6fcac4880e80354099194b1d8a444b317d27","observation_id":"46faf46c-e022-4296-a3ee-a7738fa3cfaf","resolution":{"observed_at":"2026-08-11T15:52:20.537679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.949261Z","title":"Adversarially robust clip mod- els induce better (robust) perceptual metrics","venue":null,"work_id":"10be32ea-c9c9-4d89-988a-573e16c8e465","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.544410Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:521807e63f5491c3cb4afc5141c7f702306bcb44f48c6640a474713e1bf6ff2c","observation_id":"5301a0e6-3010-4e86-bcfd-0c4e4172cdf5","resolution":{"observed_at":"2026-08-11T15:52:21.957738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.931444Z","title":"Dream- sim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":"cd1b9d63-5322-470b-bdc9-dbd2d4657fea","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.551039Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:1e0023cf795cd18ad0029783eff063bf091896b4ac77e640037bbad425d4a7dd","observation_id":"5f256352-438c-4a75-b6b7-5d347f933941","resolution":{"observed_at":"2026-08-11T15:52:21.936354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-12T17:12:13.930928Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T15:52:20.559022Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.559022Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:aa2165c92eb6a8c8391bcb4cc0160a906a96a04f996aa4185fa1dd1fc5d25067","observation_id":"248a84da-d421-42b5-b827-57a691d103b1","resolution":{"observed_at":"2026-08-11T15:52:20.559022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.916395Z","title":"R-LPIPS: An adversarially robust perceptual similarity metric","venue":null,"work_id":"593c6964-2325-4099-85a6-df490725949a","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.564908Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:5a777cf8276c25e0f2c1063de717b83ddb94ab7e5230ec25a4af97014b902d2f","observation_id":"78ca037e-9fe7-4594-8b72-ead91024827c","resolution":{"observed_at":"2026-08-11T15:52:21.921279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02080","last_updated":"2025-06-10T22:29:42Z","snapshot_observed_at":"2026-08-12T22:32:04.487235Z","submitted_at":"2024-10-02T23:00:31Z","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02080","snapshot_observed_at":"2026-08-11T15:52:20.570468Z","title":"Emma: Ef- ficient visual alignment in multi-modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.570468Z"},"links":{"cited_paper":"/paper/2410.02080","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:5a2ac83a774c8194e876a7181b5cfdacc2530a5bb08e0a11c1a1771d2d2fcf6f","observation_id":"7553f00d-4b45-46b2-a213-2e46d7755918","resolution":{"observed_at":"2026-08-11T15:52:20.570468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.899120Z","title":"Lipsim: A provably robust perceptual similarity metric","venue":null,"work_id":"d7e307bc-1bb1-4245-bd86-851db3ed9d3a","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.575211Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:9468e65cf552aa21c7202d1ec20d51ca29f7ef09c193ba5b5abbc53c4ab8a3bb","observation_id":"2f00ae9a-dee6-4749-a102-8b2fc039c5fc","resolution":{"observed_at":"2026-08-11T15:52:21.904307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.883508Z","title":"Generative adversarial networks","venue":null,"work_id":"7d45a7e7-a8b8-45fe-8099-3bd6d5e2edd8","year":2020},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.579289Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:8356388164601d0cb32fe33f55f28ee7d816cb94c4a3e1c2e10183efeb4459ce","observation_id":"055ed614-487c-4d54-a188-f7d8395924af","resolution":{"observed_at":"2026-08-11T15:52:21.888020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.870979Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"3f3049b4-3b97-44e1-95c7-54798cbc27bf","year":2022},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.583662Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:75ffe3e86d22647e8c650d4b5f0e9cd783e6a77b28726da67afccea21ac3b2ef","observation_id":"f0b984e3-ae3b-41a1-a946-365a82742d77","resolution":{"observed_at":"2026-08-11T15:52:21.874994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.856363Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":"aba3c3bb-ad73-4fc2-9a85-a6ec502a95dc","year":2021},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.588191Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:1663743cd1322ce474a9d103b9697ce367855148fab96b2e07c1771fddd745ce","observation_id":"768a2a18-9037-4942-9b8b-e99759ceb529","resolution":{"observed_at":"2026-08-11T15:52:21.861345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.840629Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"5be78dfe-95e2-4355-8423-a723af2ca266","year":2020},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.593566Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:a513d8a5120fc86c4c46672a7aedefa5c7994678371632f95ead2896f6dc3101","observation_id":"7d9e3fd5-4727-4813-983a-4c43c38a8296","resolution":{"observed_at":"2026-08-11T15:52:21.845892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.823479Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment","venue":null,"work_id":"e46140d2-1009-47b0-b717-dd8c038fff17","year":2020},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.598218Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:0e0d5f857010fcbc66f4b4c49cbdd615d2da87406414fbd16fa9e0f10aa20334","observation_id":"4bca766e-af38-420e-b26e-12dec1e77cc4","resolution":{"observed_at":"2026-08-11T15:52:21.829191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.807940Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"9bf38a87-f7ca-440e-9e07-121e5b04ab29","year":2022},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.602776Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:048398e1b3a0d977a7a563a410383d41390a820f8d646c0868becb3ba21b16f9","observation_id":"7f102026-893e-49de-817b-2145504c12bb","resolution":{"observed_at":"2026-08-11T15:52:21.812630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.792901Z","title":"Aesexpert: Towards multi-modality foun- dation model for image aesthetics perception","venue":null,"work_id":"3d8f3375-cfc9-4091-bc30-fb9529ebcdd0","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.607404Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:614a489a7e736f37cfdafb848f4ce8f53605c82a4d51d823aea3f6a2db0a3322","observation_id":"0706775c-7b58-4056-854e-575a58f0be4a","resolution":{"observed_at":"2026-08-11T15:52:21.797672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-11T15:52:20.612245Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.612245Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:50a6a9fc0ee73c96f17e916d96df0defb23d8b19a39fcdefc47775d70cfd1e7c","observation_id":"ed87fb23-beca-42d8-b7e7-1e1386342417","resolution":{"observed_at":"2026-08-11T15:52:20.612245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-11T19:41:42.384717Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-11T15:52:20.618332Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.618332Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:ab9a16c11d1e4bf0083a833786f5894cbeda71dc538e880ccfa74d44679f730e","observation_id":"2d7d4595-41c1-44fa-9c73-35d5c952ef8c","resolution":{"observed_at":"2026-08-11T15:52:20.618332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.776869Z","title":"Pipal: a large-scale image quality assessment dataset for perceptual image restoration","venue":null,"work_id":"e5656551-925a-415e-8911-cddf9f1ba7d4","year":2020},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.623290Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:9c04e7303630f6ecd497d6a4a0d44ab4f931730917330a289d2de696aadeb62b","observation_id":"87c04987-a20c-4660-bb21-60d9fa57363f","resolution":{"observed_at":"2026-08-11T15:52:21.782689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01596","last_updated":"2024-03-10T21:41:51Z","snapshot_observed_at":"2026-08-12T13:30:38.112718Z","submitted_at":"2023-10-02T19:41:42Z","title":"ImagenHub: Standardizing the evaluation of conditional image generation models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01596","snapshot_observed_at":"2026-08-11T15:52:20.628436Z","title":"Imagenhub: Standardizing the evaluation of conditional image generation models.arXiv preprint arXiv:2310.01596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.628436Z"},"links":{"cited_paper":"/paper/2310.01596","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:f5201990f1863a9b954ee10b694c29d329cc15bda4eab1fba63561ae88eb0d44","observation_id":"6adcabd3-294e-4608-9c12-f8dbd0ee536a","resolution":{"observed_at":"2026-08-11T15:52:20.628436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14019","last_updated":"2021-06-26T13:27:14Z","snapshot_observed_at":"2026-08-05T20:54:54.151486Z","submitted_at":"2021-06-26T13:27:14Z","title":"UMIC: An Unreferenced Metric for Image Captioning via Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14019","snapshot_observed_at":"2026-08-11T15:52:20.635404Z","title":"Umic: An unreferenced metric for image captioning via contrastive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.635404Z"},"links":{"cited_paper":"/paper/2106.14019","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:cccd91386e184aee6d28f0b59629af2d469971be7595a9849f231467cb28a14d","observation_id":"87f42d74-cee5-4d53-8ad1-b622642bf1c1","resolution":{"observed_at":"2026-08-11T15:52:20.635404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.759030Z","title":"Agiqa-3k: An open database for ai-generated image quality assessment","venue":null,"work_id":"53b49097-e490-423f-8d7d-e587206b4a6d","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.640156Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:0b0da00ba58274009703b7f3f3a109f36110cc17c4bb542aeb47bbe92ba2a893","observation_id":"0ebd9825-6b74-4da0-b548-49e7270fa039","resolution":{"observed_at":"2026-08-11T15:52:21.766045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03407","last_updated":"2024-04-04T12:12:24Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T12:12:24Z","title":"AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03407","snapshot_observed_at":"2026-08-11T15:52:20.645204Z","title":"Aigiqa-20k: A large database for ai-generated image quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.645204Z"},"links":{"cited_paper":"/paper/2404.03407","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:25539599247ca93699dd5877a6c5035552269b865d0265819c69325d87abea08","observation_id":"38f8cb07-b66c-48cc-b277-01fadedc1078","resolution":{"observed_at":"2026-08-11T15:52:20.645204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T15:52:20.651720Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.651720Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:3cbbb71233266812c326ec1962633d388f5df915a6e235bc96bc1de1257f89ea","observation_id":"15a2c559-3316-493e-be5f-3d9e2562158b","resolution":{"observed_at":"2026-08-11T15:52:20.651720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T15:52:20.657956Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.657956Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:e371d2b7fd8c74d89309d74484ce577dea5885bd88989c15cb0b1e9f9ab6501d","observation_id":"75bf0df2-9641-4f84-b2b8-f4038de5a9b9","resolution":{"observed_at":"2026-08-11T15:52:20.657956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.742300Z","title":"Kadid-10k: A large-scale artificially distorted iqa database","venue":null,"work_id":"37cbf26f-a135-4530-821f-90951d123c3e","year":2019},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.663794Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:00329f481b690f87bffa339299f9d69a7d12f698b29927f87b07606c27ba5de7","observation_id":"8b6c9e92-3fe4-4e4f-9893-65b40f1222a9","resolution":{"observed_at":"2026-08-11T15:52:21.747189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.726723Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"cc4fc58b-fba4-4ff9-a7b9-d618f96c4dfe","year":2014},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.668842Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:bb80a7270e6b943b074f9ce942c20c84cefe6864c174d811e98ded2cdcc8b1de","observation_id":"2856e819-fd2f-4b73-b33a-94b9572dd042","resolution":{"observed_at":"2026-08-11T15:52:21.731632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.709218Z","title":null,"venue":null,"work_id":"c7922439-e1ad-4f8f-a8f5-69e65785c4c6","year":1975},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.674338Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:4c8135cb2949193c6e49d516f2adb43678b6761355e642c3c4f3ab58a22e17ca","observation_id":"06dafb6f-09b3-47b4-ac97-9522d6245161","resolution":{"observed_at":"2026-08-11T15:52:21.713584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.693920Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"5e557e12-da77-47f2-bef8-454a53bce3bf","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.679260Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:a74f3601846bfafdc4d6b5a758fa2de056715d3a534201120164a21138610e60","observation_id":"f6262e8d-72fc-4613-89b3-5594fd668549","resolution":{"observed_at":"2026-08-11T15:52:21.699013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01573","last_updated":"2021-12-02T19:27:27Z","snapshot_observed_at":"2026-08-06T14:23:50.362039Z","submitted_at":"2021-12-02T19:27:27Z","title":"FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01573","snapshot_observed_at":"2026-08-11T15:52:20.683958Z","title":"Fusedream: Training-free text-to-image generation with improved clip+ gan space op- timization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.683958Z"},"links":{"cited_paper":"/paper/2112.01573","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:b28b4edcd3afa929986ed861913e9221aa99791607026444efc3ea13c1cdfffd","observation_id":"290c40b1-d467-494b-8394-25b0777f7ba9","resolution":{"observed_at":"2026-08-11T15:52:20.683958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T15:52:20.689029Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.689029Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:656f3e27627433802e2485e0b4e0f300a7310be49348b297b871a95eaff9e253","observation_id":"6d45ef75-527d-43ad-a1f5-789ebdbca73f","resolution":{"observed_at":"2026-08-11T15:52:20.689029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.675813Z","title":"Vandermeulen, and Simon Kornblith","venue":null,"work_id":"f9be8724-5bf4-4a6b-a753-abc2561ec781","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.694008Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:0877d484042741b16cdec32ae2ab630420d2bf20c5c9a7426932e8d7ec7ec2a8","observation_id":"1e678f20-634d-452a-97a4-631ed9541289","resolution":{"observed_at":"2026-08-11T15:52:21.680734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.660680Z","title":"Lost in quantization: Improving particu- lar object retrieval in large scale image databases","venue":null,"work_id":"9c408e18-b3fb-425c-b36e-c5b120abf284","year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.699753Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:612274773348aa3f463039ca90fa20d565f1d689c49fdb7c59f94f8cd9591345","observation_id":"0bd7fc4f-a57b-4108-bc20-f44c8c52d153","resolution":{"observed_at":"2026-08-11T15:52:21.665683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T15:52:20.706284Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.706284Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:8490acf2ea4b7b7d2d19d65d4289740f51f79be56f874ee5072a05af21675ca1","observation_id":"6dd01535-2934-4613-a92b-50ebe1af757c","resolution":{"observed_at":"2026-08-11T15:52:20.706284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.644568Z","title":"Pieapp: Perceptual image-error assessment through pairwise preference","venue":null,"work_id":"50f2669a-f6c3-4a2c-9c43-9b7ad017faae","year":2018},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.714728Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:f290bef30e2c2a4aa4476f0a0ebdd9e475fcf8127b69207b0e0006e176237e27","observation_id":"14160a5e-c550-463e-a728-50a63b09ce36","resolution":{"observed_at":"2026-08-11T15:52:21.649485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.630179Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"41ae5ca6-4ec5-4875-bd16-9882f8a63821","year":2021},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.719641Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:c443fa3c39a3c242519ac51e61352a9bc374df3d741307158bb8d48935a6f964","observation_id":"7dc182ff-f0aa-4b51-b3f7-dcbc099e7735","resolution":{"observed_at":"2026-08-11T15:52:21.634785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.615238Z","title":"Positive-augmented contrastive learning for image and video captioning evaluation","venue":null,"work_id":"7774aa1b-3576-46c7-9083-fabed57787ea","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.725645Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:fe7f19b734f0884f83b703f070cf0bc13f718b08aef3efa00d4699816e29f2bc","observation_id":"6d3e3eb5-774f-4ef3-92a7-aa683fd2a1eb","resolution":{"observed_at":"2026-08-11T15:52:21.619423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10817","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-08-12T22:23:26.737057Z","submitted_at":"2024-10-14T17:59:58Z","title":"When Does Perceptual Alignment Benefit Vision Representations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10817","snapshot_observed_at":"2026-08-11T15:52:20.730292Z","title":"When does perceptual alignment benefit vision representations? arXiv preprint arXiv:2410.10817 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.730292Z"},"links":{"cited_paper":"/paper/2410.10817","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:8c339a3c3b4c6ac1374ac3f2893718af8729ac64ca33135ed7cc47eb0399a0f9","observation_id":"986fc960-2fd1-42ca-acb7-081ec7faf1c3","resolution":{"observed_at":"2026-08-11T15:52:20.730292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T15:52:20.735706Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.735706Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:fb2a4a5e1efaa07f17998f62229d645b247355234d6697c38fd61bf19079198c","observation_id":"88bae7ca-aa88-4e61-96b3-2d5eb9dea848","resolution":{"observed_at":"2026-08-11T15:52:20.735706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.600551Z","title":"Polos: Multimodal metric learning from human feed- back for image captioning","venue":null,"work_id":"a26647ac-b0c2-4607-924b-dc4136d6054d","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.741709Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:835462a4c24f2e70ede02085987b737adc4fefa8f7feab50445a19435a977584","observation_id":"9ae66f87-1dc5-4b7f-8485-d15526238d19","resolution":{"observed_at":"2026-08-11T15:52:21.604954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-12T15:27:37.917473Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-11T15:52:20.746009Z","title":"Muirbench: A comprehensive bench- mark for robust multi-image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.746009Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:431e0cb96c2963909df693f2123c387ace662e3ed78e766cdfe63bd65f67fbb1","observation_id":"ab87bdbb-d304-417f-b270-810d1ab4a970","resolution":{"observed_at":"2026-08-11T15:52:20.746009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.576803Z","title":"Ex- ploring clip for assessing the look and feel of images","venue":null,"work_id":"07ec1008-c01f-4ffa-8ff6-896915121fd8","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.751054Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:b2134534d3af8e5f331664c8164c640d20b6e0e42edd047a161e537a3ab722af","observation_id":"240ca792-5f11-4660-926e-af9f714084f4","resolution":{"observed_at":"2026-08-11T15:52:21.588807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-11T01:43:16.181975Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-11T15:52:20.757343Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.757343Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:7a202c9cc7f723697b28d095399148272704e954e5af1ac3d468e93776ebf8ee","observation_id":"6baf2c07-0a34-4d85-b17c-83b77d28dfcb","resolution":{"observed_at":"2026-08-11T15:52:20.757343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16641","last_updated":"2024-03-04T07:06:22Z","snapshot_observed_at":"2026-08-10T00:58:11.216399Z","submitted_at":"2024-02-26T15:10:56Z","title":"Towards Open-ended Visual Quality Comparison","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16641","snapshot_observed_at":"2026-08-11T15:52:20.764418Z","title":"Towards open-ended visual quality comparison","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.764418Z"},"links":{"cited_paper":"/paper/2402.16641","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:eaee3c6d491f4aa5c1e3c1aa8badfdd610fea409d00ee8bb7dd7a33ba9af40a2","observation_id":"53337deb-fa14-454c-bb61-b742d6f0d5e0","resolution":{"observed_at":"2026-08-11T15:52:20.764418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-11T00:30:13.593181Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-11T15:52:20.771725Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.771725Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:ea5fc9ce71baab691a564f44604072b41801a847a4acb738889d2a356da44aa7","observation_id":"83722df9-9853-4a9c-8b18-115afc89969f","resolution":{"observed_at":"2026-08-11T15:52:20.771725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.541535Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"4465debc-0d43-454b-8cb4-48a1028d6f53","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.783050Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:ab8d951f991287ad4cbdf3d321de169f4ca901b19f7f114c0c99a5fadea0f3c2","observation_id":"75e7f3ee-210f-47cf-a208-2aa100b3880f","resolution":{"observed_at":"2026-08-11T15:52:21.546559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.525414Z","title":"mplug- owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"0e2702c5-4413-4187-b2c9-4efe69247c5f","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.790872Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:f0a17d67e8de26098824475b5e95a5d46cbcd68797c336f29f2bff5e476e83ad","observation_id":"16d4f2eb-1bb6-4fff-afe1-99534ca33c07","resolution":{"observed_at":"2026-08-11T15:52:21.530751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-11T15:52:20.798079Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.798079Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:a84d42712f9aef0efd4a6d1bc48f3b68b459ec8c3d6e684bd2d8578d90c16f6b","observation_id":"021d40ec-759e-4189-9059-8c0083d87534","resolution":{"observed_at":"2026-08-11T15:52:20.798079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-09T15:37:28.200871Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-11T15:52:20.803758Z","title":"Text-to-image diffusion models in gener- ative ai: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.803758Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:8fb636893ca5e383e21e2bd588b2a53ebce1efc39ce0815c8dfa28006dec63b4","observation_id":"0109bb72-16dd-4d30-afd5-29dd22b2c998","resolution":{"observed_at":"2026-08-11T15:52:20.803758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.508433Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"386a679b-d4dd-4b49-8a53-fe5e15bb4703","year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.812589Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:983c7e67600833b6730bbdb8b2b3354278cd1baa92e9833d7dba6cd5eb3fc4cb","observation_id":"63550c03-bfd8-424b-a306-0f8b6a1c56ca","resolution":{"observed_at":"2026-08-11T15:52:21.513857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.491498Z","title":"Efros, Eli Shecht- man, and Oliver Wang","venue":null,"work_id":"e216f371-bb6f-452f-b507-7721648f548a","year":2018},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.823969Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:f8267d90cdbbcac422cce9d322a89f94a5aba7b7ace6709ff2cd60bbd34f86b0","observation_id":"fd1a6379-26b0-4115-86de-fda62eba9f85","resolution":{"observed_at":"2026-08-11T15:52:21.496296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.473559Z","title":"Blind image quality assessment via vision- language correspondence: A multitask learning perspective","venue":null,"work_id":"5efc4da1-9868-4cb5-8915-ff7d582b9077","year":2023},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.831283Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:ea4d7d3f5947829db773ac3823a3c5f3ef7370228085332f07477aa16c6192dc","observation_id":"c7625820-c4d3-4a4b-808b-23313a459cfb","resolution":{"observed_at":"2026-08-11T15:52:21.480909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03070","last_updated":"2025-02-07T04:20:54Z","snapshot_observed_at":"2026-08-11T02:33:13.524662Z","submitted_at":"2024-06-05T08:55:02Z","title":"A-Bench: Are LMMs Masters at Evaluating AI-generated Images?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03070","snapshot_observed_at":"2026-08-11T15:52:20.839190Z","title":"A-bench: Are lmms masters at evaluat- ing ai-generated images? arXiv preprint arXiv:2406.03070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.839190Z"},"links":{"cited_paper":"/paper/2406.03070","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:4a77816a92c365a4f128aa720f3f3696752a04c74888810c62a1116bae146b94","observation_id":"afb4e741-d43f-4779-8027-ba6b89d1f49b","resolution":{"observed_at":"2026-08-11T15:52:20.839190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01162","last_updated":"2024-02-02T06:05:18Z","snapshot_observed_at":"2026-08-04T20:41:26.370613Z","submitted_at":"2024-02-02T06:05:18Z","title":"2AFC Prompting of Large Multimodal Models for Image Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01162","snapshot_observed_at":"2026-08-11T15:52:20.845040Z","title":"2afc prompting of large multimodal models for image quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.845040Z"},"links":{"cited_paper":"/paper/2402.01162","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:f8a4140a2391aeb3f0f7e5ba52a6041ddb4bc2a595558009eb520340a6e9262f","observation_id":"6155f7f7-7f0b-45a1-b3da-ddc8328ad328","resolution":{"observed_at":"2026-08-11T15:52:20.845040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19298","last_updated":"2024-05-29T17:26:09Z","snapshot_observed_at":"2026-08-06T10:32:29.241350Z","submitted_at":"2024-05-29T17:26:09Z","title":"Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19298","snapshot_observed_at":"2026-08-11T15:52:20.853170Z","title":"Adaptive image quality assess- ment via teaching large multimodal model to compare.arXiv preprint arXiv:2405.19298, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.853170Z"},"links":{"cited_paper":"/paper/2405.19298","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:47f572a8e6715a71ae6156a8e2a12cd02ca729d870b31cf4f8e36f82e018785d","observation_id":"8d03083d-7bac-494f-bcf0-dd6c7656c0fa","resolution":{"observed_at":"2026-08-11T15:52:20.853170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:52:21.557872Z","title":null,"venue":null,"work_id":"2ff80bcf-fb65-4555-aa05-cc2e05253473","year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.777233Z"},"links":{"citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:84ab644e29f53094dd13e5b80e77a34b3247f27aa92315dc1f7fb4b9f231673b","observation_id":"d86a91e8-aa96-4272-9426-cdbabaa8de2c","resolution":{"observed_at":"2026-08-11T15:52:21.563678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2412.10594."}