{"as_of":"2026-08-07T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fb125b5fd111926f25bce4b2e172026ab66935a6bab74847e9a0e742b2951f1","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:27:27.748564Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.01610/citation-record","integrity":"/paper/2509.01610/integrity","json":"/paper/2509.01610/citation-record.json","paper":"/paper/2509.01610"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T12:27:27.253037Z","title":"Phi-3 techni- cal report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.253037Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:da08a451435606e4d30ede11b33ba4a6ccdeb9113583118cdb48ebd2960d238e","observation_id":"d1f574b3-4004-49c8-8e3c-55cab892c658","resolution":{"observed_at":"2026-08-05T12:27:27.253037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T12:27:27.258508Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.258508Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:432d153bdeae61b37fbff509d7506e09666df85a8b10dbf805d984ead1ff397e","observation_id":"4c935171-7f80-46b8-8f73-3b7aace4c50b","resolution":{"observed_at":"2026-08-05T12:27:27.258508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T12:27:27.263431Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.263431Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:70936978b505ae7f2c1460ed41d59c0104963fa5e92b74e65d98996179bd0894","observation_id":"9fd19040-31cd-4fd4-a9e3-c43fd6659dd0","resolution":{"observed_at":"2026-08-05T12:27:27.263431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-07-06T17:11:21.633421Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-05T12:27:27.267919Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.267919Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6786a3d4cb54f33847f1472020758e96244145b45f46912a7137ef833b87e76c","observation_id":"416f724d-3c68-4ef6-a538-9b84233ed729","resolution":{"observed_at":"2026-08-05T12:27:27.267919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T12:27:27.272581Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.272581Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c234058b9ee12693778097a0222be3eeb322f5be65a946d9bfebfcdbe9995fd3","observation_id":"320ed74c-f5d9-420b-9c91-687bf8a4bf98","resolution":{"observed_at":"2026-08-05T12:27:27.272581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T12:27:27.277331Z","title":"Are we on the right way for evaluating large vision- language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.277331Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:836dbc6c0a7de9575638bb36946536c74047bc02e3fbc06398355302bf9cb1bb","observation_id":"06e2aed1-d8a9-4e36-ab9f-129346445690","resolution":{"observed_at":"2026-08-05T12:27:27.277331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T12:27:27.281965Z","title":"Self-play fine-tuning converts weak lan- guage models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.281965Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c9020bdc557d2a30750b9d7f3ee4d7b80e34332d5fc7ba8116a2303b10d54f74","observation_id":"f1af862d-6277-4e88-9be9-a3154e63f00d","resolution":{"observed_at":"2026-08-05T12:27:27.281965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T12:27:27.286826Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.286826Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:4b68bbe826ba10a5368d6ebef8fa4ec66a060795244f86da43b38bf5f54557b9","observation_id":"28d8a27c-bb4b-46e4-aaa9-8f61d7bf5d73","resolution":{"observed_at":"2026-08-05T12:27:27.286826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.291111Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.291111Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:8d93ae46a0b0a156e72c17a69cd86214f20d8900f70a085a3b14721969bcfebf","observation_id":"d9b9f837-3e73-4667-bc9c-7e7ea26dece4","resolution":{"observed_at":"2026-08-05T12:27:27.291111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01660","last_updated":"2025-04-11T23:24:37Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:53:25Z","title":"Self-Improving Robust Preference Optimization","version":4},"cited_work":{"arxiv_id":"2406.01660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01660","snapshot_observed_at":"2026-08-05T12:27:28.471177Z","title":"Self-Improving Robust Preference Optimization","venue":"cs.LG","work_id":"1a25b634-de2b-4bac-9498-9617806e4d06","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.295655Z"},"links":{"cited_paper":"/paper/2406.01660","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:ad7168f01f45ad142408f5d30d8b2d53c5ecaab4c86898561fb2fb98653cabf7","observation_id":"cf6b9be5-c95d-4ac1-9d4a-fa4e70c5cf4f","resolution":{"observed_at":"2026-08-05T12:27:28.478077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T12:27:27.300251Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.300251Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:a87b2dd6941728ae1379ffd9815b24d31049d9a8315e7dd68bd8e2a558b44bea","observation_id":"7849c7cf-8ac5-4f82-b7c4-a15dd2047b5f","resolution":{"observed_at":"2026-08-05T12:27:27.300251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.304752Z","title":"Reward model ensembles help mitigate overop- timization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.304752Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:d7764a1842bc81d7b11208bf0f5b21e1c092b8042deb14b4d93eda524bf85843","observation_id":"25de84a8-6ce4-4abb-94c1-6dcbf63da87a","resolution":{"observed_at":"2026-08-05T12:27:27.304752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.309716Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.309716Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:f7f26d572fb29b18ba7d67835cd1f1b6f7b15ba666727fd4dd2b8fe74ad099a3","observation_id":"f2b6f9bb-88c2-47ae-98a6-2035402afea5","resolution":{"observed_at":"2026-08-05T12:27:27.309716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.314082Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.314082Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:55a514777a71cace1c50acee32e5380540cf7933a943e2074a35d3057b5b7947","observation_id":"0103621a-185e-4f2d-b475-f7f8af9f2323","resolution":{"observed_at":"2026-08-05T12:27:27.314082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:27:27.318382Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multi- modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.318382Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:e46cb245684f3af9febaa55c956fa4c621cc710f799f2baa3d9af8a75723c987","observation_id":"90da2d0b-414b-43cc-878b-39ed1d204b76","resolution":{"observed_at":"2026-08-05T12:27:27.318382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-04T15:18:22.654819Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-05T12:27:27.323258Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.323258Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:809a04f618712b9e8873605a38e6f470374b553d2f0c2e50c88019e3afe66daf","observation_id":"f011d6d3-4fcb-48eb-8931-1cdf418b6bb7","resolution":{"observed_at":"2026-08-05T12:27:27.323258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T12:27:27.327711Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.327711Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:33fa7725ddc2b4fbb1900350495f1af7feedac2672a81786f4ee0e28f411c1a9","observation_id":"66190a49-3bc1-4536-b81d-6a3e48288695","resolution":{"observed_at":"2026-08-05T12:27:27.327711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-07-06T18:47:08.782799Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-05T12:27:27.332321Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.332321Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:caa0aff0478250228876578f9b15ec33b3fcec8b9cccaaf12bc6b8c259fb9c79","observation_id":"42bc6ae6-ce22-4d6e-9970-e4b71f5ef03c","resolution":{"observed_at":"2026-08-05T12:27:27.332321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-08-05T12:27:27.336733Z","title":"vila2: Vila augmented vila","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.336733Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:a3bf658f3d77eac565975e8cbe0347d3e36b8ff56a125ddbf56753772e70d442","observation_id":"b32c752a-098d-4cc0-a4ed-b31bd5e24d6c","resolution":{"observed_at":"2026-08-05T12:27:27.336733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T12:27:27.341177Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and vi- sual illusion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.341177Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:16cbc9bdb9e575325abb96ec7d68c8d867d00365dad8d2a081a856ab35afb3aa","observation_id":"02edb8e5-c7e7-422a-8a61-a909e22db5cd","resolution":{"observed_at":"2026-08-05T12:27:27.341177Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-05T12:27:27.345868Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.345868Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:59435b84cc77b187d1f494569d82580d9141c1c7d73c6e2606e54042b5291cf9","observation_id":"e7d8a105-9d58-482a-a151-9c16b8c07adb","resolution":{"observed_at":"2026-08-05T12:27:27.345868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T12:27:27.350403Z","title":"Mistral 7b (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.350403Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:400856a34df72519fa9055a27081c77a1bc33b6359240e7aae14ea09a0fc6b88","observation_id":"34a2a7b2-1722-49e8-82e6-09870a987a03","resolution":{"observed_at":"2026-08-05T12:27:27.350403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.354977Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.354977Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:d831f8b29884bce700c899fa524ba88678056a462a4b73e089078424747a0763","observation_id":"9c3c92b1-5766-418b-8d6c-ac768568c5ef","resolution":{"observed_at":"2026-08-05T12:27:27.354977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-05T12:27:27.359046Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.359046Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c496736a966210f4ae60af3b8d1fa62f4c903d69c61dd7e36b3d334f63e7cf18","observation_id":"acd8ce11-70b5-4725-8770-f498c30bbdb2","resolution":{"observed_at":"2026-08-05T12:27:27.359046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06591","last_updated":"2024-01-12T14:19:23Z","snapshot_observed_at":"2026-08-06T23:29:22.698447Z","submitted_at":"2024-01-12T14:19:23Z","title":"Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06591","snapshot_observed_at":"2026-08-05T12:27:27.363208Z","title":"Prometheusvision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.363208Z"},"links":{"cited_paper":"/paper/2401.06591","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:7863725cbf6054ac7f969ec4c339a4f4a8fe16221a63e28ffe65828c98e8843a","observation_id":"3662a7e8-8af8-48b9-8b10-acc81c44ad5d","resolution":{"observed_at":"2026-08-05T12:27:27.363208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.367800Z","title":"Seed-bench: Benchmark- ing multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.367800Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c917a0071f60eab39d3fda73a3b9ca013a2407d16389c46d3e7f25e0c2562e06","observation_id":"07985a7d-1f8e-4115-98be-191d10668a3f","resolution":{"observed_at":"2026-08-05T12:27:27.367800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T12:27:27.371859Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.371859Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6f457088ec58f283eb034207d261522eb5df8dfc352b96c55576ef9c190cc601","observation_id":"dba96a56-05ab-4b2b-b413-3f53fbd6fc1d","resolution":{"observed_at":"2026-08-05T12:27:27.371859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.375958Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.375958Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:852302f503899b7e3cf6e9eae7e1b838652ecffb324ba63312f57255847b2857","observation_id":"9d6d39c8-6cdd-40ae-8751-8b9193767366","resolution":{"observed_at":"2026-08-05T12:27:27.375958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-05T12:27:27.380128Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.380128Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:237c10d3e0f5d9600199b73a55751e386f5b2501eecb55e9fc05fba74726e1d7","observation_id":"82399be2-2ebe-412b-b0e7-3220ae1b890c","resolution":{"observed_at":"2026-08-05T12:27:27.380128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10884","last_updated":"2024-11-05T05:13:13Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:42:08Z","title":"Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10884","snapshot_observed_at":"2026-08-05T12:27:27.384681Z","title":"Multi-modal pref- erence alignment remedies degradation of visual instruction tuning on language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.384681Z"},"links":{"cited_paper":"/paper/2402.10884","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:419930246acdf7e1eb40bcbe4abe65b96e9f43ba9f31f50e6ad7d0560e4b14c3","observation_id":"c33c94a5-eab8-4461-85ea-8c3b8f5d4bc2","resolution":{"observed_at":"2026-08-05T12:27:27.384681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.991433Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"b5727bfe-497f-42bc-a2d9-cec9313ac803","year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.389624Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:50a911590e309b30245fdf080fac25e3d267aadcb4b243022b79e34338646cd7","observation_id":"30ec6ac9-7ef6-4634-bebb-c6747c8d80e3","resolution":{"observed_at":"2026-08-05T12:27:28.995747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.977767Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"51efbfb4-1c97-4447-a66b-e03851ee2315","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.393767Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:bc752342c04b329fbcb3cd96eca4efe37cd6f3dfddeee58a3c2585da1b0c2c0d","observation_id":"a7466534-95ef-460a-87be-f8b235512307","resolution":{"observed_at":"2026-08-05T12:27:28.982356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.963404Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"44264a10-54bb-4653-8d4e-8899a90b9ed5","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.397960Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6accac5bbe0f7cadec91b9b0e86998c4abf5045575ca1fb46b662d359902fd3c","observation_id":"37bfb32d-4845-4131-9a94-ce197e6f21f5","resolution":{"observed_at":"2026-08-05T12:27:28.967890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.948842Z","title":"Visual instruction tuning","venue":null,"work_id":"687ca0cd-f4af-40a0-a01b-4fae081e7cc4","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.402375Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6604e1e4ecb7aa1501538f76af8dadef121f765a0e2cb7cab49ff5b17ad85e0a","observation_id":"950d56e3-af88-4e43-8517-b06cfc55a828","resolution":{"observed_at":"2026-08-05T12:27:28.953364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T12:27:27.406477Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.406477Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:ff2fc4453f426d4603ddb38e8d72961de3c8eb85fa81dbdfe337acc6e76894a4","observation_id":"2ed6002d-8d62-4da6-b39e-f97824231234","resolution":{"observed_at":"2026-08-05T12:27:27.406477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-05T12:27:27.411073Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.411073Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:efa7fd406487cbd826c3f9e627cc32216e1a0fc758d40c507640efa4959acb73","observation_id":"6e1762ba-a8fd-48c6-992c-3711ca12ccfd","resolution":{"observed_at":"2026-08-05T12:27:27.411073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.935578Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"b9e4affe-2edb-4c25-8d96-4a2aae649370","year":2022},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.415644Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:2c06a5fcbf3510ad3aeda9d67a64f6fc4a5d4057387e486d0a51335a67b43a57","observation_id":"d20ad29c-87a5-4429-8f20-0c1e1d7690fe","resolution":{"observed_at":"2026-08-05T12:27:28.940018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.921106Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts","venue":null,"work_id":"ea04babc-8369-4308-9217-a5ad62fb7c09","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.420121Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:3d550bfa80c70801f5b04c4484ca794e02740f57f0a819868d41d2987b1f3c48","observation_id":"e97ef82c-565c-4adc-a8db-04befdf0f731","resolution":{"observed_at":"2026-08-05T12:27:28.926060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-06T16:39:25.477229Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-05T12:27:27.424386Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.424386Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:5b0d71d7fdd81dcc01c453026bc7d61946d4addedf6ceac8c34296b33a42e0e1","observation_id":"13178546-7ca2-40d5-bc30-fc30b9c5f40e","resolution":{"observed_at":"2026-08-05T12:27:27.424386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.905512Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"cb29655f-a8bc-434d-bf90-a483a0319280","year":2022},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.428752Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:44d636ebfdcde340621980ce8d0130f0392a140d8f8a50480e51b8a6e8c4313a","observation_id":"f5f06566-9406-46e5-a889-f9733b351302","resolution":{"observed_at":"2026-08-05T12:27:28.910736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-05T12:27:27.432883Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.432883Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:77b2f9e263c8eb33e63cd95c2b9c434f138f45660e4ac9729e150216ec5cbcab","observation_id":"2e92be31-7c7f-4e0c-8035-366addc3ef44","resolution":{"observed_at":"2026-08-05T12:27:27.432883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.890817Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"52d1441d-116b-4d92-b8c7-9909ddc692d7","year":2019},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.437976Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:2e2e5d10f9ef9e1ede49d4c3926404a588924fe5248ee137710205fd75c7f26b","observation_id":"b41f54fc-d48d-402c-ba54-270dfcb7dbe9","resolution":{"observed_at":"2026-08-05T12:27:28.895584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.877301Z","title":"Cognitive perspectives on peer learning","venue":null,"work_id":"0f90fa23-dd90-4fdd-b72e-d6fd61917b4d","year":2014},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.442099Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:94593803b7bfcb7a0344b9337144e4a6530bb3ce57bcfcc66f2bc977aeb8e91a","observation_id":"3f687fb6-424b-45d1-b9a3-966342625502","resolution":{"observed_at":"2026-08-05T12:27:28.881934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.863454Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"c0aa09d3-b1e2-4c14-a491-5ac12e4af850","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.446058Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:1995507a47598ee60bc31366dd95424f29f724fbfb71a99fecd6410f5759b532","observation_id":"0326da7b-9272-4cf7-a834-aee208336164","resolution":{"observed_at":"2026-08-05T12:27:28.868024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T12:27:27.450137Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.450137Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c63d0d0f2b4aff234fb5e4b1746dc968122bbcc0af185ae5e7cf6cc6683407d3","observation_id":"597baf8e-52f1-47be-b60e-8c8c75ca7ca0","resolution":{"observed_at":"2026-08-05T12:27:27.450137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.849179Z","title":"Im2text: Describing images using 1 million captioned photographs","venue":null,"work_id":"a6397970-2ea0-4a84-a623-d71508e3e231","year":2011},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.454211Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:3e42957ac08f942f9dc1cd24c743dbc4e89df4f731d366caf90345ba98bb4442","observation_id":"63c5b924-f8ec-461d-a37e-57946919abf0","resolution":{"observed_at":"2026-08-05T12:27:28.853943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.458154Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.458154Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:f4c794519dfcef50fa7a208f851ea100cf8152eae1ca997f6f34e07a12943a94","observation_id":"75b0c464-63e7-407c-97fe-aa939aa3cdd9","resolution":{"observed_at":"2026-08-05T12:27:27.458154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.826178Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"a6f475ee-5b6c-41b9-9cb2-4fe7ae5dfdc1","year":2021},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.462330Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:9ea9e2ded0877297d8253cbaa692ae1113fddabbadb1b83bdf72e899317a3719","observation_id":"90f58df7-b687-4767-a59c-96d4a4f2d225","resolution":{"observed_at":"2026-08-05T12:27:28.830811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.811694Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model","venue":null,"work_id":"76e0e4bf-48b8-4080-8932-7f7eee0eda62","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.466445Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:8566aa66e885dd1217f37c4fc03ac9f7ad1fbf2529e5c40473d307f60610df20","observation_id":"b85784c7-5972-4bb2-be94-8da74896a9ff","resolution":{"observed_at":"2026-08-05T12:27:28.816705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T12:27:27.470827Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.470827Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:06f50b7e48c1afbbdedeb8cca2716a559fd51ec6a4a21dae2181af7343f59dac","observation_id":"c7b418e8-b013-4630-a495-c252d4887b88","resolution":{"observed_at":"2026-08-05T12:27:27.470827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.797919Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"846d3ef0-b2ea-4b6f-88d2-d88889d581bc","year":2022},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.475190Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:b38b657ace80bb6414faafa6cd2fd4fec13a635ebdc04d07a82e1eb8f0d2ef43","observation_id":"7399ffbf-fc36-446c-ad1e-8773d4ff093d","resolution":{"observed_at":"2026-08-05T12:27:28.802576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.783596Z","title":"10 Towards vqa models that can read","venue":null,"work_id":"40224de4-b691-4910-bd9b-0b6554623e20","year":2019},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.479349Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:c6e7da0171bffdf38faa37b28c310f7aa87caf2d7ab32e717f3a8c3c94c53ff1","observation_id":"a79e8db8-136f-46f2-9a94-1aeb06a99d5e","resolution":{"observed_at":"2026-08-05T12:27:28.788522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T12:27:27.483552Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.483552Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:41ec17d4f9d3c17441c08783c0e533dcd91cfa152a344f5366cd40aeefb4da0e","observation_id":"9ab19677-5ba0-4af5-8d41-9ecc26741426","resolution":{"observed_at":"2026-08-05T12:27:27.483552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T12:27:27.487953Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.487953Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:827d5e13651408af5bbf829efd336221624dbadca4c17302066056d4f8a06895","observation_id":"67920b50-78f7-444c-84e6-d4870286071c","resolution":{"observed_at":"2026-08-05T12:27:27.487953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-05T12:27:27.492852Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.492852Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:bd5ea8f009b950fdfa786020708af02d7498d76dbaa04efec0b54e38da66ed17","observation_id":"37673a03-885b-4207-9ee3-6ed10e60fa56","resolution":{"observed_at":"2026-08-05T12:27:27.492852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-05T12:27:27.498054Z","title":"Replacing judges with juries: Evaluating llm generations with a panel of diverse models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.498054Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:debb649487b886d833c08f5b26e353707cff8ef7b867cca379895722d947d73b","observation_id":"bd83f7df-7bb9-49f0-ba36-e49354fd136e","resolution":{"observed_at":"2026-08-05T12:27:27.498054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-05T12:27:27.502470Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.502470Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:feaa932ef78e6385b3ec3074daa8c6e4e9abeed86a7cca8f06b8a4762bf5e296","observation_id":"97f328e9-a648-4b06-ba86-243fe4c8799c","resolution":{"observed_at":"2026-08-05T12:27:27.502470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T12:27:27.618880Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.618880Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:423f546326d0fa9ec20ce449c0fa0db5da8036e46eda833e230c38091fefaaba","observation_id":"ac0dddc9-b246-4a3f-adfb-aae0a8e5797f","resolution":{"observed_at":"2026-08-05T12:27:27.618880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-06T10:06:21.140448Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-05T12:27:27.624059Z","title":"Self-taught evalu- ators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.624059Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:e3df99b26e17625c56a1b5c7fd34c7bf6299b8233ede27886584bfc2f6cc3b1c","observation_id":"13502761-0064-481f-a9ac-e087347d6afa","resolution":{"observed_at":"2026-08-05T12:27:27.624059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-07-06T18:19:38.561528Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-05T12:27:27.628450Z","title":"Enhancing visual- language modality alignment in large vision language mod- els via self-improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.628450Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:0a33fc69f7f8cd79fa0fb7394f96e71f913f61c1c94a560e7d32810a6be76563","observation_id":"fe9fa07f-4118-41da-b60a-83beba9e54c7","resolution":{"observed_at":"2026-08-05T12:27:27.628450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T12:27:27.632845Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.632845Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6729209ad7f843e886eabbf50dc12ed5cd2cdd74cee2f76b6adca4aed38b48d6","observation_id":"abf26adc-4c7d-4de0-b06e-55ef50970bdd","resolution":{"observed_at":"2026-08-05T12:27:27.632845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.769189Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm","venue":null,"work_id":"89df2a93-668d-4bef-9a7a-bb3984f8ce3b","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.637328Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:b1433a6a6fb2f3b80e82e458016ee82fa077b92331c2bf3e6f67eb8a2c0c9334","observation_id":"8cbc05ac-6824-4707-82ad-3e89cd1b6897","resolution":{"observed_at":"2026-08-05T12:27:28.774047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.754099Z","title":"Pytorch image models","venue":null,"work_id":"f3011363-c0de-4edf-8014-416237e45009","year":2019},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.641868Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:16890f363115bf02c0e2e584025823e5b1ae0c7c40410ebd808ada8ccc527008","observation_id":"940e9c55-ee50-4923-8c90-8447152a6c2a","resolution":{"observed_at":"2026-08-05T12:27:28.759248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.738211Z","title":"Gpt-4v (ision) is a human-aligned evaluator for text-to-3d generation","venue":null,"work_id":"ad164ef4-6189-44c6-a3fb-1e30dc3210b2","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.646815Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:9228bd118051a2ce44348a5aa27114a360f510162fbbf46e6135a7e5b4dcc3ca","observation_id":"bcd8c5eb-a312-4d5d-9586-bbe4bcfb2a80","resolution":{"observed_at":"2026-08-05T12:27:28.743120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-05T12:27:27.650830Z","title":"Self-play preference opti- mization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.650830Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:12e608a67996e36ea27171d391bbe08b81d8e7d373e8b70a92c157a87976fcfa","observation_id":"6cc5a664-6b16-4ddd-9aa2-fbd97503f7b5","resolution":{"observed_at":"2026-08-05T12:27:27.650830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.723798Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":"f0743a4f-b453-472c-8e3e-74a4050a5f5f","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.655183Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:fef96364e5a0a735d36fbd4230f7a3b90d5dcd32f2ef40a1d9a7cbc35400b2a5","observation_id":"c5fecd07-c731-45a4-85ac-1c5864a6c4b5","resolution":{"observed_at":"2026-08-05T12:27:28.728428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-05T12:27:27.660164Z","title":"Llava- critic: Learning to evaluate multimodal models.arXiv preprint arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.660164Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:13f28ca66f869cbbe665dae8e68b61e5a67e5696901e66e53c00192bc9ed4c70","observation_id":"066bc149-5148-4573-8a15-86059f0bc9a7","resolution":{"observed_at":"2026-08-05T12:27:27.660164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20370","last_updated":"2024-09-30T15:06:53Z","snapshot_observed_at":"2026-07-06T19:24:35.007698Z","submitted_at":"2024-09-30T15:06:53Z","title":"The Perfect Blend: Redefining RLHF with Mixture of Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20370","snapshot_observed_at":"2026-08-05T12:27:27.664545Z","title":"The perfect blend: Redefining rlhf with mixture of judges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.664545Z"},"links":{"cited_paper":"/paper/2409.20370","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:2dd4b468ee183853c0010875afb965ba2f5dd7324d19755de5d4931d4537c121","observation_id":"baadd476-aa13-4853-a946-7bf01cdf7f50","resolution":{"observed_at":"2026-08-05T12:27:27.664545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.668920Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.668920Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:9b76d7c174b4846e58dd17464893949cb6a801cfd13639c2e63364658dc34ad9","observation_id":"fb65bd6c-1ccb-4633-b0cf-d7c324804aec","resolution":{"observed_at":"2026-08-05T12:27:27.668920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.707877Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"9570c60f-fd13-426d-9351-cf2f9d24a930","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.673178Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:7103a17229da017a444f5dfd3e6133260052a1f4e7457f838e2b65fe232c104c","observation_id":"83b74cf1-87ec-45fe-90d2-88c05ee447f7","resolution":{"observed_at":"2026-08-05T12:27:28.713157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.677331Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.677331Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:83c47569e6e03cee2b467c6aaa10d0d1e8e0ae47c991db04825b0a3ef03225bd","observation_id":"f2ef592e-4043-490e-bf7f-5fa2444b0a74","resolution":{"observed_at":"2026-08-05T12:27:27.677331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.693663Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"9fc7e99a-1f41-4e93-8919-42ab444712c7","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.681561Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:5bc1ea0b22b977d05608b1d928a71f2b95f9f53c1b976576c8d11c3d2bfae4b7","observation_id":"42ec46ea-b362-462d-9aa1-88f10452c4f3","resolution":{"observed_at":"2026-08-05T12:27:28.698235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-05T12:27:27.685759Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.685759Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:8f11e75c804b9503ddc1eff146d587744e73f25c51ca5719968bb8c490736a45","observation_id":"8180939e-c5b8-47c3-9251-d259117020b4","resolution":{"observed_at":"2026-08-05T12:27:27.685759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T12:27:27.690602Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.690602Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:a8514f06384b5574f7edd86baf68bc61affb771720e07a02b40465d583004dd9","observation_id":"46ff7d88-df70-4e82-ba8b-5a1480e5df3a","resolution":{"observed_at":"2026-08-05T12:27:27.690602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.678910Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"34c74dee-4ee3-4294-96b0-9d36b6ac4154","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.695166Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:62a904df38b8bd8f0cf71184f3c627e4f4f3cb7967cef8b8940c9262c43784d8","observation_id":"c205a9dc-0742-4e1d-bede-ceea4f8e680e","resolution":{"observed_at":"2026-08-05T12:27:28.683747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:27.699358Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.699358Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:0ea8f77a43bfeed20f3df4e8319bd5febb345df942030dbe3cce89606182fc9e","observation_id":"03f86c78-4642-404b-a7cd-beae779d7761","resolution":{"observed_at":"2026-08-05T12:27:27.699358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-05T12:27:27.703738Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.703738Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:1abe695f7c5b16ac5c5a053f4a216006ca2843a7db1abbec8152aaaca87dbcb4","observation_id":"bdb9d7e0-39e1-48e3-879a-fda3f07ec52d","resolution":{"observed_at":"2026-08-05T12:27:27.703738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T12:27:27.708238Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.708238Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:6d1b35a36cf6aeaa33b95262d859d933e1696db34c819e198ce769feb67a2ac4","observation_id":"b5d7a50d-8486-46ac-bcce-8160e888fd94","resolution":{"observed_at":"2026-08-05T12:27:27.708238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-05T12:27:27.712961Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.712961Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:b68efd1c9cc986ff2426efe0a7275295b2fc6fefc0cc44adc71ed7227681b8c0","observation_id":"8b2d4026-ad5a-41cd-bf59-bca8ef8d7882","resolution":{"observed_at":"2026-08-05T12:27:27.712961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-07-30T21:22:18.339303Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-05T12:27:27.717430Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.717430Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:f7349794c5dad1c65bf837d8b56af1faf23bcd80c0fdb21ae07d6d47658e0ce1","observation_id":"c5bb8057-b04a-42c5-bca4-1400387f4776","resolution":{"observed_at":"2026-08-05T12:27:27.717430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10501","last_updated":"2024-08-21T11:36:47Z","snapshot_observed_at":"2026-07-06T18:00:52.903522Z","submitted_at":"2024-04-16T12:19:54Z","title":"Self-Supervised Visual Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10501","snapshot_observed_at":"2026-08-05T12:27:27.721849Z","title":"Self- supervised visual preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.721849Z"},"links":{"cited_paper":"/paper/2404.10501","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:37e8f859dda4e86bc14576f559c77c6eeb0cd86ebd5963d33abd6703978ec4ea","observation_id":"2c1e9cbc-fa00-4d8b-821b-9d59a657ad41","resolution":{"observed_at":"2026-08-05T12:27:27.721849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T12:27:27.726448Z","title":"Helpfulness","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.726448Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:472b8186a278b3c3d57cddbe135c003ff6312ca0b5f1fa0150a8c10e09867121","observation_id":"b463cf89-7f55-479e-8d87-a6594ee11399","resolution":{"observed_at":"2026-08-05T12:27:27.726448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.654249Z","title":null,"venue":null,"work_id":"52414946-662c-4153-b530-68885598e91b","year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.731433Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:3cb4ff81b75089af958afe66c60e76e70f6b05667e0e5e5f12a53828d530946a","observation_id":"a5740f99-3e2c-4ca3-bb51-b46176fd490a","resolution":{"observed_at":"2026-08-05T12:27:28.659736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.640035Z","title":null,"venue":null,"work_id":"7e506b77-3c7b-408e-883d-73fa70d37866","year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.735735Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:a250cc596e806679ae2327427827d61a6bf5086aa3bd8e6140e75096a4a3ff25","observation_id":"acdac01d-a280-4cea-a386-e0382703e33a","resolution":{"observed_at":"2026-08-05T12:27:28.644530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.625597Z","title":null,"venue":null,"work_id":"593009fd-568a-45c4-a23e-5f659a5881a1","year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.739945Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:9e0dc2f2bccdaf428f28f83fd32a5e747c28174367d5ddf99c0437f5ca672832","observation_id":"d2caee6f-78d4-4a12-b36b-5cee87651a6c","resolution":{"observed_at":"2026-08-05T12:27:28.629984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.611471Z","title":null,"venue":null,"work_id":"a30dec59-ca11-4c1b-8baa-e3990b4665b6","year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.744158Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:3bf085a330382054352ee490973175e70b118a0605ba88b029e36f4d9a32c2f2","observation_id":"5c4fa842-9a44-4f81-b912-1ab012c1b2fc","resolution":{"observed_at":"2026-08-05T12:27:28.615834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:27:28.597009Z","title":"• Rating Guidelines: Models receive detailed explanations for scoring each dimension","venue":null,"work_id":"e87719d5-e00f-41dc-afd7-31bf6577f695","year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.748564Z"},"links":{"citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:8be94e9927974ddc18d529e2fbc074d903f38d7105986fe364f82f3ba780caab","observation_id":"cc9c01e3-a089-4554-bcb7-abdc2d80a1c7","resolution":{"observed_at":"2026-08-05T12:27:28.601990Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2509.01610."}