{"as_of":"2026-08-11T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba6e893771f35f3c243da8ea62af2f604f068cc8323db65795fdff99674fe7c7","coverage":[{"denominator":143,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:22:51.589424Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:31:11.070908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:45:35.591791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05384","snapshot_observed_at":"2026-08-03T12:31:11.070908Z","title":"Q-Ponder: A unified train- ing pipeline for reasoning-based visual quality assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02918","last_updated":"2026-07-09T13:46:12Z","snapshot_observed_at":"2026-08-08T14:30:54.428298Z","submitted_at":"2026-01-06T11:00:17Z","title":"Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:31:11.070908Z"},"links":{"cited_paper":"/paper/2506.05384","citing_paper":"/paper/2601.02918"},"observation_digest":"sha256:377ec76f9d252c54e687161ef735f77e7ebde8465077d146d86680ed8096fe9b","observation_id":"e76b0625-b3a2-4934-93b2-586efc0f96a1","resolution":{"observed_at":"2026-08-03T12:31:11.070908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2506.05384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05384","snapshot_observed_at":"2026-07-01T08:45:35.591791Z","title":"Q-ponder: A unified training pipeline for reasoning-based visual quality assessment.arXiv preprint arXiv:2506.05384","venue":null,"work_id":"66cdc954-a7ef-4606-a1be-68c0e17f9187","year":2025},"citing_paper":{"arxiv_id":"2601.15356","last_updated":"2026-05-08T05:52:31Z","snapshot_observed_at":"2026-08-03T04:50:16.597694Z","submitted_at":"2026-01-21T08:02:32Z","title":"Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T12:44:12.618007Z"},"links":{"cited_paper":"/paper/2506.05384","citing_paper":"/paper/2601.15356"},"observation_digest":"sha256:326949d3e0b3ab6fa29f27138c45acd9bba28746851971c1dcfd8de5f6c2e1bc","observation_id":"278c1c0a-e0db-4cc1-9c0e-86c543c89510","resolution":{"observed_at":"2026-05-16T12:47:54.152422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2506.05384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05384","snapshot_observed_at":"2026-07-01T08:45:35.591791Z","title":"Q-ponder: A unified training pipeline for reasoning-based visual quality assessment.arXiv preprint arXiv:2506.05384","venue":null,"work_id":"66cdc954-a7ef-4606-a1be-68c0e17f9187","year":2025},"citing_paper":{"arxiv_id":"2604.19587","last_updated":"2026-04-21T15:38:49Z","snapshot_observed_at":"2026-08-03T01:32:14.204319Z","submitted_at":"2026-04-21T15:38:49Z","title":"SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:12.484462Z"},"links":{"cited_paper":"/paper/2506.05384","citing_paper":"/paper/2604.19587"},"observation_digest":"sha256:13ed2d3fdfaff467adff293502dc920aa2c8d4d7b41e1bd241403dbfc0c23419","observation_id":"bdbc6dea-8260-4d49-ab1c-ef34fcfbbdd5","resolution":{"observed_at":"2026-05-11T13:16:03.545962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2506.05384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05384","snapshot_observed_at":"2026-07-01T08:45:35.591791Z","title":"Q-ponder: A unified training pipeline for reasoning-based visual quality assessment.arXiv preprint arXiv:2506.05384","venue":null,"work_id":"66cdc954-a7ef-4606-a1be-68c0e17f9187","year":2025},"citing_paper":{"arxiv_id":"2606.29760","last_updated":"2026-06-30T07:05:18Z","snapshot_observed_at":"2026-08-10T16:29:33.902736Z","submitted_at":"2026-06-29T04:07:46Z","title":"MR-IQA: A Unified Margin View of Regression and Ranking for Blind Image Quality Assessment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:49.706047Z"},"links":{"cited_paper":"/paper/2506.05384","citing_paper":"/paper/2606.29760"},"observation_digest":"sha256:7f90ef0cf0c356b361753b231635975de8d7cc7d33da95a79c6bf6a06ffe2b54","observation_id":"ef5c3d0e-d007-4f44-8412-ec5d5c845290","resolution":{"observed_at":"2026-06-30T06:44:19.633385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2506.05384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05384","snapshot_observed_at":"2026-07-01T08:45:35.591791Z","title":"Q-ponder: A unified training pipeline for reasoning-based visual quality assessment.arXiv preprint arXiv:2506.05384","venue":null,"work_id":"66cdc954-a7ef-4606-a1be-68c0e17f9187","year":2025},"citing_paper":{"arxiv_id":"2606.29760","last_updated":"2026-06-30T07:05:18Z","snapshot_observed_at":"2026-08-10T16:29:33.902736Z","submitted_at":"2026-06-29T04:07:46Z","title":"MR-IQA: A Unified Margin View of Regression and Ranking for Blind Image Quality Assessment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T07:08:45.796716Z"},"links":{"cited_paper":"/paper/2506.05384","citing_paper":"/paper/2606.29760"},"observation_digest":"sha256:5ab25bce67d2c8823a8a64a12b18de81f995957a8ae91461ee43b8e23153e442","observation_id":"879b01d2-3c65-4734-ab68-bf766646ac03","resolution":{"observed_at":"2026-07-01T08:45:35.593423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05384/citation-record","integrity":"/paper/2506.05384/integrity","json":"/paper/2506.05384/citation-record.json","paper":"/paper/2506.05384"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:42.996193Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:42.996193Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:f7f29b137e63bf951bf63f42b0bfcec9e4cae146a367ed17ff6a1b926a6b2fd9","observation_id":"5e3062a3-881c-438f-8753-4a3274c0fedd","resolution":{"observed_at":"2026-08-07T11:22:42.996193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:22:43.038873Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.038873Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:5facc17c4661ffea85338681d6c65ce721db64d678d57e8570155c65da7451f9","observation_id":"8a05f739-afd6-4eda-afaf-66d0079d3abe","resolution":{"observed_at":"2026-08-07T11:22:43.038873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.120027Z","title":"Deep neural networks for no-reference and full-reference image quality assessment","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.120027Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:1648fd2db01873ace52cde3e6e64ee881ff2b70d82cfc41c24279cf1952c8cbd","observation_id":"8337e0d9-3071-4c76-9049-7d91bc98beb8","resolution":{"observed_at":"2026-08-07T11:22:43.120027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.178702Z","title":"Phocolens: Photorealistic and consistent reconstruction in lensless imaging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.178702Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:b48acadb7227426bc7d27fc1750d32f6670fa93f6fba1605540127d7475360aa","observation_id":"0f9767c2-b6a9-41ab-b57e-de9d3bd079c7","resolution":{"observed_at":"2026-08-07T11:22:43.178702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04226","last_updated":"2023-03-07T20:36:13Z","snapshot_observed_at":"2026-08-10T21:02:39.542314Z","submitted_at":"2023-03-07T20:36:13Z","title":"A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04226","snapshot_observed_at":"2026-08-07T11:22:43.210066Z","title":"A comprehensive survey of ai-generated content (aigc): A history of generative ai from gan to chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.210066Z"},"links":{"cited_paper":"/paper/2303.04226","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:11dc8d0c49ff5f16faebd1ee406015c89e8f2c2a5b5a9db3788e51c6095adcbd","observation_id":"2245206f-11ef-4b6d-80a0-ec5258b1c28b","resolution":{"observed_at":"2026-08-07T11:22:43.210066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.286724Z","title":"Q-ground: Image quality grounding with large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.286724Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:2a718051362655767884ba85182ad8b8f58e46bda0775d3406e2f37d323088b8","observation_id":"ab358159-7b1c-4bc5-8aeb-f6651ff31d89","resolution":{"observed_at":"2026-08-07T11:22:43.286724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.361908Z","title":"Promptiqa: Boosting the performance and generalization for no-reference image quality assessment via prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.361908Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:aa7f58796cbeb2dce6bdfe423fac7bcdd89cb75a92010d8e3d09f1a683e27d88","observation_id":"e4b7da5b-bc24-463e-8819-5ec68cdeec50","resolution":{"observed_at":"2026-08-07T11:22:43.361908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10161","last_updated":"2024-11-15T13:07:22Z","snapshot_observed_at":"2026-08-11T02:36:48.104755Z","submitted_at":"2024-11-15T13:07:22Z","title":"SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10161","snapshot_observed_at":"2026-08-07T11:22:43.430265Z","title":"Seagull: No-reference image quality assessment for regions of interest via vision-language instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.430265Z"},"links":{"cited_paper":"/paper/2411.10161","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:e382353d20019bc3088b4f761637dfe79847bfb5d29bdf5fa47d0117e5310624","observation_id":"f250c247-cb08-44dc-a9b6-eeedb1f6ef44","resolution":{"observed_at":"2026-08-07T11:22:43.430265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.484367Z","title":"Study of subjective and objective naturalness assessment of ai-generated images.IEEE Transactions on Circuits and Systems for Video Technology, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.484367Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:0e48bbe7141df17f3d06facadc7a0e1c480ca7453366b5d3e87e31dbd359c842","observation_id":"944be268-6eaf-4487-8fff-51625d463f74","resolution":{"observed_at":"2026-08-07T11:22:43.484367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.560340Z","title":"Prompt-based test-time real image dehazing: a novel pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.560340Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:51811b07434b17374f0ea227f77f27f78f30f323ca68471878a4904b371ef2ed","observation_id":"3380e968-4e5a-447c-a0f4-152ef8d77d0d","resolution":{"observed_at":"2026-08-07T11:22:43.560340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.600871Z","title":"Perceptual image quality assessment with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.600871Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:bf44296e600c3fbc4cfe10bfe2f4b0360dcbc8683390391d007c0cb9b2665b7e","observation_id":"215dd89a-a1b0-444c-b896-80b1d15aadfd","resolution":{"observed_at":"2026-08-07T11:22:43.600871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.692048Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.692048Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:bde4a0d02d2bd561b58e4c111fe44d1be6d90fa0f1443815e07943dd548d2931","observation_id":"faf89e3e-9e7c-4914-8369-b261db64c681","resolution":{"observed_at":"2026-08-07T11:22:43.692048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.801197Z","title":"Deep rein- forcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.801197Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:ad30a04e1561afb2ea2559de9ffb9a9df6822d8c592873b8261d6a11c9cad26f","observation_id":"94018c48-c4d1-4868-90ea-eb29e9df386f","resolution":{"observed_at":"2026-08-07T11:22:43.801197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.859410Z","title":"Perceptual quality assessment of smartphone photography","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.859410Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:23a35b530d223dcf68982d195715753f8daedae0788495eb9c8e77167d4bde6c","observation_id":"0594f54a-f833-4bdb-84c2-b5429b517872","resolution":{"observed_at":"2026-08-07T11:22:43.859410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:43.944823Z","title":"Live in the wild image quality challenge database","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:43.944823Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:56f4908c02b80a35479f5aebae720c0ee8154e642c025e759420ae1e72663980","observation_id":"71df64aa-e36a-4090-8976-71efa250f1fb","resolution":{"observed_at":"2026-08-07T11:22:43.944823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:22:44.007832Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.007832Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:5d4a86b5318c896def79db48d8a4bcec5a9c685e23ff77195ad085da8642042c","observation_id":"495d0e1e-d0ff-47be-90bc-6b32d3d4cab2","resolution":{"observed_at":"2026-08-07T11:22:44.007832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T23:05:47.958732Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T11:22:44.051500Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.051500Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:32f7c066f88f3f32890ed3d145139a43b6fcfc4ea6e96d0751ac6d2625de2b2d","observation_id":"23dca6e3-ebf9-46de-8494-cb092f44b9b5","resolution":{"observed_at":"2026-08-07T11:22:44.051500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.165206Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.165206Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:fa92ddd457bd05fce3905df9f5eb624bd3ebd9db950350ee92d547c3be8b05e1","observation_id":"f508f699-bcde-4e9c-a34e-a5808673d366","resolution":{"observed_at":"2026-08-07T11:22:44.165206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.272300Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.272300Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:c83a123e0f2b70af7ba5fc95b181a57973ec84cbe482cf81863ba421e00cc184","observation_id":"9f7d73d4-2194-4f4d-8581-e108a7d5f074","resolution":{"observed_at":"2026-08-07T11:22:44.272300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.307210Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.307210Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:9bd17bbb65b3de322a90f9d597d88582de404bae925ac12febbf205d3cdb9614","observation_id":"a384c7a2-df11-41f7-9a72-a3f33d76f6ea","resolution":{"observed_at":"2026-08-07T11:22:44.307210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.451950Z","title":"Most apparent distortion: full-reference image quality assessment and the role of strategy","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.451950Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:adf2375e1c716e745ff672f5a887bbc4f572622741e43d29283dec32286dfb21","observation_id":"01d831bb-3c67-42b0-a5dc-aba5dd619660","resolution":{"observed_at":"2026-08-07T11:22:44.451950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.537837Z","title":"Agiqa-3k: An open database for ai-generated image quality assessment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.537837Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:fd927c4aa447bab2e89f68224bea4364392f14dacd723a94c13d7f4ecbacd1a0","observation_id":"66eee500-8d0b-4b5f-898b-152a70e6abf5","resolution":{"observed_at":"2026-08-07T11:22:44.537837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.601563Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.601563Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:375b8fd50d9093c7f7e502e9e43c1a5fa2da061f6d561e472f44688e85406d6f","observation_id":"cbea88d5-b09d-4b6e-82d7-82189c35ae25","resolution":{"observed_at":"2026-08-07T11:22:44.601563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22679","last_updated":"2025-05-23T08:41:50Z","snapshot_observed_at":"2026-08-07T16:29:27.502751Z","submitted_at":"2025-03-28T17:59:54Z","title":"Q-Insight: Understanding Image Quality via Visual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22679","snapshot_observed_at":"2026-08-07T11:22:44.700327Z","title":"Q-insight: Understanding image quality via visual reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.700327Z"},"links":{"cited_paper":"/paper/2503.22679","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:f91ebfc7c2fce6d70135e8a39c64f138d6c7104b6160ada9e475c2cc1532b081","observation_id":"af69b475-a00a-4cc2-8388-fb419e9b0713","resolution":{"observed_at":"2026-08-07T11:22:44.700327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.733872Z","title":"Kadid-10k: A large-scale artificially distorted iqa database","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.733872Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:abcbb0d78b770d47772d1e4823e3b7862fba618ac0036c508d10ac53b6f6ae93","observation_id":"d775c01f-f2c3-4d5b-bfa2-8f51902a7b91","resolution":{"observed_at":"2026-08-07T11:22:44.733872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.808986Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.808986Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:88893ef3fe5b90f0e30885cc00b132eef7eab5b128873fb7ef5dd971593b066b","observation_id":"e73c82f7-598b-40ed-bfca-1f47dd5be824","resolution":{"observed_at":"2026-08-07T11:22:44.808986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.894043Z","title":"Rankiqa: Learning from rankings for no- reference image quality assessment","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.894043Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:06c3b1892325ce49b4a61480fde451aa7dd055a8788e11a5b55befd288118318","observation_id":"83d37042-b9f1-4fa1-9225-05f29939120a","resolution":{"observed_at":"2026-08-07T11:22:44.894043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:44.992553Z","title":"Cid: Iq–a new image quality database","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:44.992553Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:697f74e8a0a109a19efbe8cfd67204b3d01c5a2f0273220ac9fa4d4f3cbdd410","observation_id":"b6c33788-4c66-4db0-953e-224c2a4de005","resolution":{"observed_at":"2026-08-07T11:22:44.992553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-08-05T23:52:52.919433Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14239","snapshot_observed_at":"2026-08-07T11:22:45.145896Z","title":"Infigui-r1: Advancing multimodal gui agents from reactive actors to deliberative reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.145896Z"},"links":{"cited_paper":"/paper/2504.14239","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:df7e5a0f0407ca3b3f92364077d58f0daf42d06ce25b499e2d3b4c283cfc5031","observation_id":"1fc98cc6-0ec4-4457-93f7-6330c7f265c0","resolution":{"observed_at":"2026-08-07T11:22:45.145896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:22:45.208749Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.208749Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:953fac8304ff0029c0d37573a16d697541da07b5a659328a81851c422d153dec","observation_id":"b589a7ea-3bd6-4128-99e9-0f89e207c519","resolution":{"observed_at":"2026-08-07T11:22:45.208749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-07T11:22:45.285035Z","title":"Ui-r1: Enhancing action prediction of gui agents by reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.285035Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a5215a30808b92fe7d7030081b37258d7354ed4226b537134637a1e24ebe725e","observation_id":"7319e903-7492-446e-ba4a-e1960f4ec777","resolution":{"observed_at":"2026-08-07T11:22:45.285035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.345145Z","title":"Learning a no-reference quality metric for single-image super-resolution","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.345145Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:b5405fc2d7747cfd5046f1eb2ecbfda340610863efe53928f294831005cf952b","observation_id":"4c0cab02-1962-478f-b333-a5b5a79be75a","resolution":{"observed_at":"2026-08-07T11:22:45.345145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.421560Z","title":"End-to-end blind image quality assessment using deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.421560Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d6901db4b024ff2b45db2bbec5da71d60a7c04113f5a62887f66ad10aecef3c4","observation_id":"55b7b1b0-66a5-4241-841f-3b109d9f1107","resolution":{"observed_at":"2026-08-07T11:22:45.421560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.478843Z","title":"No-reference image quality assessment in the spatial domain","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.478843Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:1709ea77239f97220d9c09da63f610ec58a451aae90c3a5fdcffd9d9f13dc8cf","observation_id":"d2a79e74-ae17-4b1d-9c96-1556d9a6341e","resolution":{"observed_at":"2026-08-07T11:22:45.478843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.636953Z","title":"Making a ¡ °completely blind¡± image quality analyzer","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.636953Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:cb77c7f32812d1490344c724e0e3f12e024a9e2950ea84882238ead1c170cda7","observation_id":"801d2841-59a3-40f2-83bf-a1840c95bfeb","resolution":{"observed_at":"2026-08-07T11:22:45.636953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.788187Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.788187Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:09459c75bbf2b32a0c080cce05553fba528dedc2ccb71227f744a04fec1d9018","observation_id":"5fc98678-9933-45fa-a771-8c53f26914ae","resolution":{"observed_at":"2026-08-07T11:22:45.788187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:45.964616Z","title":"A two-step framework for constructing blind image quality indices","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:45.964616Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:9777b2f0b3a32dbb6a91ce1b90445ed3d4c6faa8959050660147ac62c5ba3ac5","observation_id":"ab4db865-2c86-47cb-91ce-843cb9a3bd71","resolution":{"observed_at":"2026-08-07T11:22:45.964616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.100684Z","title":"Blind image quality assessment: From natural scene statistics to perceptual quality","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.100684Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:ffad5170a0def995fbd438f26c7e9878dfb07e61095147d996ae16456be89ce6","observation_id":"b843b709-b139-4753-9eac-752145acfedc","resolution":{"observed_at":"2026-08-07T11:22:46.100684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.204124Z","title":"Blind image quality assessment using a deep bilinear convolutional neural network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.204124Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a72239f4622d88ca90cc465990ba7af58910af5ec2844228e983c9d0672fe4ca","observation_id":"8a9b4dc2-2bc5-4a6f-95e0-ccb6fec3a349","resolution":{"observed_at":"2026-08-07T11:22:46.204124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.385887Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.385887Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:e2774a4e2e7ac1083d782809b63e2b701fd413a42fd5d143fe3c578c6597f0a1","observation_id":"0a54c4a0-569f-4014-9790-4319d07af2ac","resolution":{"observed_at":"2026-08-07T11:22:46.385887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19634","last_updated":"2025-03-19T13:55:33Z","snapshot_observed_at":"2026-08-07T20:37:56.716831Z","submitted_at":"2025-02-26T23:57:34Z","title":"MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19634","snapshot_observed_at":"2026-08-07T11:22:46.567623Z","title":"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.567623Z"},"links":{"cited_paper":"/paper/2502.19634","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a3469a875188010399e4a204e1982fdc2ded7c63b03f4a1d232046d345ec8a02","observation_id":"c9cc2324-a571-4895-822c-83e6c158173a","resolution":{"observed_at":"2026-08-07T11:22:46.567623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.676465Z","title":"Image database tid2013: Peculiarities, results and perspectives","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.676465Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:e26c7911be0cc50ea714b05b0247711577f21a22cacd31a81619c977cc113b31","observation_id":"19ae3b72-7f91-4063-b2ec-222dc939191d","resolution":{"observed_at":"2026-08-07T11:22:46.676465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.790374Z","title":"Tid2008-a database for evaluation of full-reference visual quality assessment metrics","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.790374Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d389a5c874ed2d4a7c2bfded2be1d4759e5bc271f4b0109d25631a283952dc15","observation_id":"6210cf54-2d26-4fea-bb92-f54a8a03d51b","resolution":{"observed_at":"2026-08-07T11:22:46.790374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:46.894950Z","title":"Pieapp: Perceptual image-error assessment through pairwise preference","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:46.894950Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:5f0c0315ff30b122fb9a25f9c0f09a872b44f9ab0ccf10e6bcc84afb044f0151","observation_id":"1d81b1cd-e44f-446d-b32c-641a22a98cc7","resolution":{"observed_at":"2026-08-07T11:22:46.894950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:47.012587Z","title":"Blind image quality assessment: A natural scene statistics approach in the dct domain","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.012587Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:2221bac7eb1115d5cfb265051824e05dd9b26dcde6f8d9965d0736ae62c313fc","observation_id":"1e1698de-8439-40d1-bbe8-7e79ee8478e6","resolution":{"observed_at":"2026-08-07T11:22:47.012587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:22:47.156059Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.156059Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:589b664d42bfdcec4c7537895dc9e30eae88763e8e4661642314a032b4606895","observation_id":"d53ece29-985e-4071-9c60-730b769eb2c1","resolution":{"observed_at":"2026-08-07T11:22:47.156059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:22:47.315251Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.315251Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:bf856fe514f279d57eb66b147224614689a0c15f61b97eba1c755022bcc18094","observation_id":"1d106e0a-caf1-4589-a8a0-5c7963549d1c","resolution":{"observed_at":"2026-08-07T11:22:47.315251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:47.417861Z","title":"Image information and visual quality","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.417861Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:2d3255ce7bbaa0ea9c87515454eec0f3e686798196b909d3496228c28054b7bb","observation_id":"d4521ee9-58d8-46b0-a36b-2cc576aa49c1","resolution":{"observed_at":"2026-08-07T11:22:47.417861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:47.532235Z","title":"A statistical evaluation of recent full reference image quality assessment algorithms","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.532235Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:087d5c94a184383a1156cd90792f5986bb4d714a7ad7ff12a44a17370c686b2b","observation_id":"00340765-bc0a-4c5c-9b1d-3daacf62324d","resolution":{"observed_at":"2026-08-07T11:22:47.532235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T11:22:47.716144Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.716144Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:51235ba43af258b85ebbc82b28a6529c437315cfa07a1fd8d069bc16efacd8f0","observation_id":"11997311-cacb-429e-87cd-3be562bd8175","resolution":{"observed_at":"2026-08-07T11:22:47.716144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:22:47.879209Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.879209Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d4c046b80d59ecbe3c181f427c98bd778ca5cf80408a6ad9373b5a43f495c2c9","observation_id":"446590fa-a179-49ad-93c7-fe66d56ffbf1","resolution":{"observed_at":"2026-08-07T11:22:47.879209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:47.975509Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:47.975509Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:f055191ca428e79873dc816d86c76cc8e85017b371c0b0f49a62d3b7dddcc356","observation_id":"a4363afd-462b-4ec9-9908-64c7b8537846","resolution":{"observed_at":"2026-08-07T11:22:47.975509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.028769Z","title":"Blindly assess image quality in the wild guided by a self-adaptive hyper network","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.028769Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:1db71d79cffae30057f44188a7bad76beb1b8c316dbab6ec931f0c6bca9d9d74","observation_id":"7715d83b-c46a-4598-aa9c-1d6d4ec1092d","resolution":{"observed_at":"2026-08-07T11:22:48.028769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.115849Z","title":"Graphiqa: Learning distortion graph representations for blind image quality assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.115849Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d16c3797d8eb4f4889bef4b0956b84e72d81d0960e3d45503be85d976997337a","observation_id":"3e5c15d5-b3fd-4acb-ba5d-77489c6398a9","resolution":{"observed_at":"2026-08-07T11:22:48.115849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.214310Z","title":"Nima: Neural image assessment","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.214310Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d2e08f8279074c11ff9bdb3b337f02767119bdd905411732b527e36dcefa7eeb","observation_id":"a6428483-cc5f-4e7a-9c3d-94887cb9b68f","resolution":{"observed_at":"2026-08-07T11:22:48.214310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.285651Z","title":"Learning a blind measure of perceptual image quality","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.285651Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:375f9a7aab2a63f4995a72cefa6634917f875ecb825582dee0f9fad2d3478ce5","observation_id":"5e8500fb-13c9-47d6-a6a1-c8ddc2baf39d","resolution":{"observed_at":"2026-08-07T11:22:48.285651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.381377Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.381377Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d11097e89911e3913972ef9d76ab9fdeb8761738c2d72471d28343bd7dfbeac0","observation_id":"dd6f523b-f60f-4d45-8a1a-c1a466700eab","resolution":{"observed_at":"2026-08-07T11:22:48.381377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.447207Z","title":"Gpt-4v (ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.447207Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:94e1b561f592b6aa43538d7abd77e0c1372b846bb6fca6cc6417d661e5eecbb6","observation_id":"b7f272a8-d1a3-4bff-b30f-a425f9b2b75b","resolution":{"observed_at":"2026-08-07T11:22:48.447207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.541738Z","title":"Exploring clip for assessing the look and feel of images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.541738Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:9a88c42d8096f4dace7670bac4136ecfc19c4ea4acaaf46f89b26c92e6e41625","observation_id":"13061859-7674-4faa-bf1c-398617065adc","resolution":{"observed_at":"2026-08-07T11:22:48.541738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.620080Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.620080Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:7710de06dfb2eacc414088f3e5d9dec89346f31b3e546b49c297deae03666fd5","observation_id":"e131f97c-9eb0-403e-9ac9-d5a488482f7d","resolution":{"observed_at":"2026-08-07T11:22:48.620080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14021","last_updated":"2025-03-18T08:32:22Z","snapshot_observed_at":"2026-08-07T16:55:34.940137Z","submitted_at":"2025-03-18T08:32:22Z","title":"MP-GUI: Modality Perception with MLLMs for GUI Understanding","version":1},"cited_work":{"arxiv_id":"2503.14021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14021","snapshot_observed_at":"2026-08-07T11:22:55.083923Z","title":"MP-GUI: Modality Perception with MLLMs for GUI Understanding","venue":"cs.CV","work_id":"6a6b300f-456d-4ded-b317-ce77f81de888","year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.737064Z"},"links":{"cited_paper":"/paper/2503.14021","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:73c7fc767db9984aef1e1b4db3f17eb5194f0b3efa483c3940e9608a89c7666c","observation_id":"adf2f297-a7f8-42f7-bfae-8ad83440b995","resolution":{"observed_at":"2026-08-07T11:22:55.089749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-11T01:43:16.181975Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T11:22:48.836267Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.836267Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:f7fc1450befadaa005e86bc356237067a5fdd8af9b47c8330c1a5eda7b202f52","observation_id":"65cf78c1-f762-4134-85a9-5a22fc707003","resolution":{"observed_at":"2026-08-07T11:22:48.836267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:48.909722Z","title":"Q-instruct: Improving low-level visual abilities for multi-modality foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:48.909722Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:595196ff519462e38329102050520b804e57865091c4e54419d26c6a178a9071","observation_id":"a694c952-93db-4643-ac21-0439f6bcf5aa","resolution":{"observed_at":"2026-08-07T11:22:48.909722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.004345Z","title":"Towards open-ended visual quality comparison","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.004345Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:17e1174b446c6118eba234cb94e7c9b7773b1fe4677a067190b9c87b88197034","observation_id":"d500d21a-2e70-43a0-8902-5c69d2502cea","resolution":{"observed_at":"2026-08-07T11:22:49.004345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.098769Z","title":"A comprehensive study of multimodal large language models for image quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.098769Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a924c720b24cc66ba3783256976a7e38508cb42b894080e1b0d65ac6a145e9b7","observation_id":"20d2e0ef-6dab-416c-9872-e1d8cced16b7","resolution":{"observed_at":"2026-08-07T11:22:49.098769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.173436Z","title":"Maniqa: Multi-dimension attention network for no-reference image quality assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.173436Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:f8c6d2e9766147bad2a8c4f4006929556e7aae870935a01b7cc1a06895659ec2","observation_id":"ca304a87-8e6c-4327-ace1-eaf7144c601f","resolution":{"observed_at":"2026-08-07T11:22:49.173436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.261080Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.261080Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:4973a44a5700e17c9326da9a71191b2b7bfe8a2e69ac189fcc5da1148a35548d","observation_id":"f92efe22-d80e-4cef-b895-bbc562aa1c73","resolution":{"observed_at":"2026-08-07T11:22:49.261080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.370227Z","title":"Teaching large language models to regress accurate image quality scores using score distribution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.370227Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:688155f45ae583cb875285975928fa0cee7c62f6c9c6b21ffb3ebd2985bd4ef4","observation_id":"f8bebeca-6da2-4111-90c0-32295e79e29c","resolution":{"observed_at":"2026-08-07T11:22:49.370227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.436525Z","title":"Descriptive image quality assessment in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.436525Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:da2ff9c95f1d0cbc4257b61dbe73b0b73458a99d2b3a6ad02ab64016e68d2c40","observation_id":"b5a3d067-2f6e-49c6-b001-86c9502c9634","resolution":{"observed_at":"2026-08-07T11:22:49.436525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.514771Z","title":"Depicting beyond scores: Advancing image quality assessment through multi-modal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.514771Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:5dd4dfe527aea7d8071a808e7a9b5254e7d6a2f0ccaa0c67b488bce2c29f65c7","observation_id":"fee8388c-44d7-42c8-b728-7462e8a7d74f","resolution":{"observed_at":"2026-08-07T11:22:49.514771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.597252Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.597252Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:82e40b2b03e7810e04c4789cd5262c8471e945057e37b8d028523efbde262156","observation_id":"8d005e88-8534-41b0-b104-e4dcaa8eaa7c","resolution":{"observed_at":"2026-08-07T11:22:49.597252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.689598Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.689598Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:045399ed639c58a2a8fb57e1187d0e01806f35a031a33c6e75990d1e53bf3810","observation_id":"c2ed15d8-69cb-4bc6-b934-ec7f14b6e2ad","resolution":{"observed_at":"2026-08-07T11:22:49.689598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.783373Z","title":"Sf-iqa: Quality and similarity integration for ai generated image quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.783373Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:47f016fd757b00d9082f4874b0aebb7c26c212f910f0777d30894a00c6e3d83f","observation_id":"9f673720-0fb3-44d4-a5b5-04fb6bbb0b28","resolution":{"observed_at":"2026-08-07T11:22:49.783373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.877811Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.877811Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:fab4c8b53d053cd7dc5163705d936a6cec2d817fda4024fc0ecdc66b42a772e3","observation_id":"60cde204-1f40-4564-a7d7-acc7fe5084fb","resolution":{"observed_at":"2026-08-07T11:22:49.877811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:49.967967Z","title":"Fsim: A feature similarity index for image quality assessment","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:49.967967Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:6e7844d576fd194a5376a69600d32fa616bf7ff1cc1bd79241ef7105212847a1","observation_id":"218b86d8-3bd2-4233-8245-e870f78165aa","resolution":{"observed_at":"2026-08-07T11:22:49.967967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.047021Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.047021Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:659961fe5eafdc87aad873a8ee8ab8d1db7d74c75bcba09e63a15372209ab751","observation_id":"8fcc6445-ca6c-401a-873c-8c33f8d2034c","resolution":{"observed_at":"2026-08-07T11:22:50.047021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.115807Z","title":"Continual learning for blind image quality assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.115807Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a43b19f347496bd64cfd0da10245518565c6d4bafde216d29b0f839e3424966b","observation_id":"9c840ca8-f8c2-4700-a833-c9b16ee322a7","resolution":{"observed_at":"2026-08-07T11:22:50.115807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.197326Z","title":"Blind image quality assessment via vision-language correspondence: A multitask learning perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.197326Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:3409b4f0509114346a58f4ec934e91c535578f09528893ab2b8efd84811b42f8","observation_id":"f4e6989f-dc4a-48f1-a8a3-9ab41ea3079b","resolution":{"observed_at":"2026-08-07T11:22:50.197326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-09T06:34:06.783851Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-07T11:22:50.278097Z","title":"Gpt-4v (ision) as a generalist evaluator for vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.278097Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:53b137fa422b3205bdbbabb314b51ca891a4ef03c239739eda4f48c209a5c3a4","observation_id":"7420504c-a95c-4c50-9097-cb00434d0fdc","resolution":{"observed_at":"2026-08-07T11:22:50.278097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T11:22:50.342524Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.342524Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:057729470e22ae8940dd95565d0f22a97b0be9daba1212203c1cac048299ae8d","observation_id":"bf83dd4e-5a6b-4fe9-b9fc-de3de6805c90","resolution":{"observed_at":"2026-08-07T11:22:50.342524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20063","last_updated":"2025-03-02T12:17:51Z","snapshot_observed_at":"2026-07-06T19:24:22.008202Z","submitted_at":"2024-09-30T08:05:00Z","title":"Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20063","snapshot_observed_at":"2026-08-07T11:22:50.396698Z","title":"Q-bench-video: Benchmarking the video quality understanding of lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.396698Z"},"links":{"cited_paper":"/paper/2409.20063","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:12500134ac3db6661aa3ca5b4c04af1364d59aaa98512e58cef4571635fa92c4","observation_id":"01b6e318-d9eb-41c8-bc34-3804bd53e64d","resolution":{"observed_at":"2026-08-07T11:22:50.396698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.461525Z","title":"Quality assess- ment in the era of large models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.461525Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:22e881263a36bfcfb1ecb8043ec4de9a9b34d84695589921879bb0ab5b3750eb","observation_id":"971f844c-def0-40ba-bc69-246ae1de1957","resolution":{"observed_at":"2026-08-07T11:22:50.461525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.518298Z","title":"Learning conditional knowledge distillation for degraded-reference image quality assessment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.518298Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:c89b29fe259b9ea07abd1442f805031018d5256427a08884456c6cadfac7db53","observation_id":"48f74f51-9218-4c85-ae43-68b5b80a9b17","resolution":{"observed_at":"2026-08-07T11:22:50.518298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:50.578538Z","title":"Causal-iqa: Towards the generaliza- tion of image quality assessment based on causal inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.578538Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:b50732aa1b8a9ee23d5143cac059b9756d64e17a262c87ad691513cbdaa84063","observation_id":"0538431f-5837-4e0e-8a80-357eda3cd126","resolution":{"observed_at":"2026-08-07T11:22:50.578538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.188653Z","title":"Quality assessment of image super-resolution: Balancing deterministic and statistical fidelity","venue":null,"work_id":"2229df6d-ba49-4493-87e0-0a23919f19b5","year":2022},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.648544Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:699e543790b732356e57e2ba1c818e203865c05dd2884e02c82da16c1efbbaa3","observation_id":"0b094d24-af10-4b2d-81c9-91ae50bd5fba","resolution":{"observed_at":"2026-08-07T11:22:56.193636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.171937Z","title":"Metaiqa: Deep meta-learning for no-reference image quality assessment","venue":null,"work_id":"515ce204-7a5b-4a0e-ab10-fdb5af04d9cc","year":2020},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.704981Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:5f530d9864032cf70b5f7d871f553125e7bba3c77580f689f47e993f4949d468","observation_id":"c632fef1-c9d5-402f-a179-1c7ce16450bd","resolution":{"observed_at":"2026-08-07T11:22:56.177443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19298","last_updated":"2024-05-29T17:26:09Z","snapshot_observed_at":"2026-08-06T10:32:29.241350Z","submitted_at":"2024-05-29T17:26:09Z","title":"Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19298","snapshot_observed_at":"2026-08-07T11:22:50.767674Z","title":"Adaptive image quality assessment via teaching large multimodal model to compare","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.767674Z"},"links":{"cited_paper":"/paper/2405.19298","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:e29cfed88e753ed79a8054b1b1af6e6edddea5091c0114a7da377ee4fcf46745","observation_id":"0299c436-682e-49cb-ac9c-67d3d93c65e8","resolution":{"observed_at":"2026-08-07T11:22:50.767674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17809","last_updated":"2025-02-16T05:30:30Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T12:11:26Z","title":"An Intelligent Agentic System for Complex Image Restoration Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17809","snapshot_observed_at":"2026-08-07T11:22:50.842977Z","title":"An intelligent agentic system for complex image restoration problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.842977Z"},"links":{"cited_paper":"/paper/2410.17809","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:bc68b187c5c74652713249104d9a18bdfa9d21d496afffaf4e039ebc6795c3a0","observation_id":"f8c62296-95c6-4524-83d9-4dbc189d26b1","resolution":{"observed_at":"2026-08-07T11:22:50.842977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.158595Z","title":null,"venue":null,"work_id":"2cd07b47-f460-4ec7-86ad-edf05c3e070c","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.905661Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:a6ecde3158356a213a87dfccfc4561f711ee86c719fda7f91d2187026d462e53","observation_id":"01dd35b6-ae01-45e8-a80b-33b58eec141b","resolution":{"observed_at":"2026-08-07T11:22:56.162283Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.144005Z","title":null,"venue":null,"work_id":"4f475b1a-a254-4ed5-9d66-1cbd819373ea","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.958760Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:dc22ecaecb9aa8821112c8e326027caf87740b563f4605358136a238af78bb70","observation_id":"85a8aed2-1eff-4ec9-8a4e-c08cc5a0b3fc","resolution":{"observed_at":"2026-08-07T11:22:56.148197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.130363Z","title":"compression noise)","venue":null,"work_id":"2303b1d7-99d6-4a25-96c7-1051154976f6","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.024547Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:7cfea69c4280f9b78923e992f3710086e0a6aee6ce77368e8cb69ba003fa017e","observation_id":"113bc2a6-4f7a-4e5d-81fd-06bfb6a204f8","resolution":{"observed_at":"2026-08-07T11:22:56.134529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.117191Z","title":null,"venue":null,"work_id":"0922b8ea-0d4f-4ebd-bcd8-5dbca533502d","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.078963Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:1d7206607987e0efa4e196bce1b151b39ba84f739a269b2f51f2045ed005f575","observation_id":"0994ff35-8053-4e9e-971d-fd8c9f0316a1","resolution":{"observed_at":"2026-08-07T11:22:56.121101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.102813Z","title":null,"venue":null,"work_id":"bfd1b393-e31c-40ec-a85d-5adbe1a73726","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.140099Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:550589d79a1745ae1a7cbbc98b9ea076b0ab626af4b1c13b590cdc0c8b5785e3","observation_id":"15c81ec6-9de5-4f3a-9192-53f663f4eaa9","resolution":{"observed_at":"2026-08-07T11:22:56.107111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.088502Z","title":"Special rule: Artistic style may conditionally override low-level flaws, but must not affect final score","venue":null,"work_id":"7af6a665-fb5c-4751-b019-844a3848e3d5","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.212100Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:ed381d4893c1cc371485f0a7f0f594be5f057e673cfd3ff8bca09a464a9a8cba","observation_id":"d3abd72f-a8d7-4b77-925c-72f6c15c1299","resolution":{"observed_at":"2026-08-07T11:22:56.092917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.074941Z","title":null,"venue":null,"work_id":"e2cb0796-f7b9-4132-9b79-495456d7bbf7","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.281254Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:b7ae75ecc6d807c7e8d21ace3bf1dc6044c8f16cacef97aad75f306c455406e3","observation_id":"444fa779-0074-4722-8861-a9f93712cb04","resolution":{"observed_at":"2026-08-07T11:22:56.079114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.059941Z","title":null,"venue":null,"work_id":"6a79c964-dd5a-433d-824f-9760d90a1000","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.335668Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:05da6ae39cd528fdec969ed732a7247b3efbe1a8e7cec4ae0e42abcf3e2c5c24","observation_id":"bbce5382-ea61-44bc-af6f-f2cd01934782","resolution":{"observed_at":"2026-08-07T11:22:56.064183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.042443Z","title":null,"venue":null,"work_id":"923007b9-ff0b-4d72-9f39-ffd74e2c13cf","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.395970Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:1e34c2e26385ff2ab4722fc2ca2bed6c8ce9d1a7cbef0f84845298ffb27dbb14","observation_id":"d405ed6a-aff4-4862-b580-f1320856053c","resolution":{"observed_at":"2026-08-07T11:22:56.046820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.027300Z","title":null,"venue":null,"work_id":"a35ab9cc-b7ba-4202-9d45-30bfa8669b08","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.448239Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:94d5d8aedf1289cf3a264976f39e2091055d6f28c9502b6fe7b75950d381e601","observation_id":"271b3c92-84b0-42bd-9e34-21e2a6d479db","resolution":{"observed_at":"2026-08-07T11:22:56.032136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:56.013234Z","title":null,"venue":null,"work_id":"7e47231f-e275-479d-87ff-4993a079cd80","year":null},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.535053Z"},"links":{"citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:d563955adb19cb79abf4ecd5f3a7be49d20971c4795c5c3190ceb14dd7dd6500","observation_id":"f0b182cd-756a-48c6-8870-6f0013b67504","resolution":{"observed_at":"2026-08-07T11:22:56.017428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.04647","last_updated":"2022-07-07T10:14:03Z","snapshot_observed_at":"2026-07-06T12:06:35.380847Z","submitted_at":"2021-11-08T17:16:38Z","title":"Composition and Style Attributes Guided Image Aesthetic Assessment","version":3},"cited_work":{"arxiv_id":"2111.04647","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.04647","snapshot_observed_at":"2026-08-07T11:22:54.654151Z","title":"Composition and Style Attributes Guided Image Aesthetic Assessment","venue":"cs.CV","work_id":"c6b1bdb2-766f-4dc2-8809-e4a82fab9843","year":2021},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:51.589424Z"},"links":{"cited_paper":"/paper/2111.04647","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:641d6ff27d4763c576fd330ea231473467e98586c48c078027a127d588a3a759","observation_id":"5f6bc4a7-78eb-4240-95dc-a7a121a4fd48","resolution":{"observed_at":"2026-08-07T11:22:54.660884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:38:22.705426Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":93,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":143},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 143 outbound references and 5 inbound Pith citation observations for arXiv:2506.05384."}