{"as_of":"2026-08-08T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06d84d7bcce355b9b01fa234d709390e067e20a69048c884e9eb028ae32a1026","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:03.367306Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:33:36.634359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T21:41:16.983561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"cited_work":{"arxiv_id":"2506.13888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13888","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-genrm: Enhancing vision-language verification via vision experts and iterative training","venue":null,"work_id":"1629bdaf-6dd7-4172-b53a-ae37886ebce5","year":2025},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2506.13888","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:6a558c0661f1c71142a380a5c3306fc62f0e620ef86be5ede61ef144ce726614","observation_id":"f598c56b-c547-4a9b-887c-e6ea53c849e7","resolution":{"observed_at":"2026-05-11T21:41:16.993491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13888/citation-record","integrity":"/paper/2506.13888/integrity","json":"/paper/2506.13888/citation-record.json","paper":"/paper/2506.13888"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:33:53.663253Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:53.663253Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:98ad80efbdb62817f929ca1905c275e973e1caa90f2f5bbae840db98957f5285","observation_id":"71f73914-ffcc-4ad3-bd6f-45c80ff82150","resolution":{"observed_at":"2026-08-07T00:33:53.663253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:33:53.903503Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:53.903503Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:2cdd1ea8f378de8f47439f75d6ae4b5b8f5f0cd84bfa494d81f62a889ff57072","observation_id":"5079a9e2-c7f8-4ffb-9c4a-243bfe007e95","resolution":{"observed_at":"2026-08-07T00:33:53.903503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-07T00:33:54.034506Z","title":"Vlrewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.034506Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:94f635ae9f0239ec111445746bd5b49446248524d44c7a8c48a8f7b7e702106d","observation_id":"cf97bcee-cb13-452b-a8e5-636f7213a605","resolution":{"observed_at":"2026-08-07T00:33:54.034506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:11.067987Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"a2ecfed7-4ed7-465a-b89d-c13e2724cfea","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.154868Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c2890947c13fee0daa91791e8476209c673f5134da05a8a08f7073abdc6c80d2","observation_id":"81c9655d-a4f7-480e-9544-4e8fff1455be","resolution":{"observed_at":"2026-08-07T00:34:11.216046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.829571Z","title":"Silkie: Preference distillation for large visual language models, 2023","venue":null,"work_id":"e4bca2ba-0819-4823-9eec-4ea9cd1458fd","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.359009Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f190db62c95fa5784efb49f70148df515c58e0e8b047e5a290c4a2ebc8851c95","observation_id":"5e70e07a-1c5a-468c-b233-6d55cccb9a60","resolution":{"observed_at":"2026-08-07T00:34:10.902201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T00:33:54.489101Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.489101Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6c41f72790087b522062182a040ddc48871718c6cdff7ccfaf3f84454c9c13d0","observation_id":"92dc206b-2f27-4936-aa35-eeeed62849e3","resolution":{"observed_at":"2026-08-07T00:33:54.489101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:54.584748Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.584748Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:19e16504f22ef39097d1eed5aede2a331a4c25d4be42d297ddd727e09747bfae","observation_id":"6e16397a-fb4e-43db-90b2-7bc3c5970f64","resolution":{"observed_at":"2026-08-07T00:33:54.584748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.614290Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization, 2024 a","venue":null,"work_id":"a9f9d40e-19c2-4c8d-bc31-1ac63e9849c2","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.714834Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1fb1d949bd57a25f9b384ab24c39aa4a8b1452f75894ee23bf60d7f14ccaf9ee","observation_id":"19d226a1-faaa-4712-8c19-de7c679ac146","resolution":{"observed_at":"2026-08-07T00:34:10.724456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:54.836665Z","title":"RLAIF-V : Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:54.836665Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:52c3edb60ae1381f788be1c368d1ce6b286dd0d2dc80205f8d45009274d2829b","observation_id":"92bb1aed-1ce9-4191-ac09-1bfdbc1d0dee","resolution":{"observed_at":"2026-08-07T00:33:54.836665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.413528Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"e1b0bb8f-7821-4c97-ad59-bd7ccf76e891","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.007073Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:0bab8e00e6222079cb42cb8120272ce2374403011b04f132f1a48572c998c73e","observation_id":"8407a231-d41b-4fa5-9edd-13a16d08b29b","resolution":{"observed_at":"2026-08-07T00:34:10.525501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:10.095026Z","title":"Self-rewarding language models","venue":null,"work_id":"459563f7-257a-4105-ae07-e510a592e060","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.131233Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:463193a453c043acff21f8aadd79deb356f76d13b2330b7950b937492e76328e","observation_id":"85f44ca7-2d2b-438f-8211-0fd8af44114f","resolution":{"observed_at":"2026-08-07T00:34:10.219552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.701147Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"09663d80-e320-42b4-a260-d80aa08e6152","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.313774Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a395fa1cb5240585c0330da6e945333f6026811337a7599344288f9cf7d6811e","observation_id":"897f665c-b0f7-4224-82fe-a734ff476882","resolution":{"observed_at":"2026-08-07T00:34:09.840092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-07T00:33:55.414768Z","title":"Rlaif vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.414768Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1c50171bdf055a88b10341f77503041932e16f0d5211e66327a1e1e2ccc04ab2","observation_id":"43432bc8-86d9-40e3-8f00-ea415d2bb00c","resolution":{"observed_at":"2026-08-07T00:33:55.414768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.415368Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"11354ce9-7005-438d-9943-402f0f31d030","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.542063Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:ad1bb87bf70e4ce4a934c54cb4a6357223e6f89c450c40ef80d14ea4b8caf537","observation_id":"aec22b80-3c18-4d55-b9d6-c941a1c09b7c","resolution":{"observed_at":"2026-08-07T00:34:09.535629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:09.044742Z","title":"RAFT : Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"6685b33f-b852-4297-82f0-a64467960342","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.710576Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d5c5760631c654692beded5abd4675275e3b11477392f9ecba52c7d6006dee75","observation_id":"ea707d35-2e93-4723-aeed-3f9c65a8d884","resolution":{"observed_at":"2026-08-07T00:34:09.221417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.662687Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":"40618a68-872d-46b4-83b3-43936628a102","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:55.944239Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:a2fcf3b2cf54aaf407bd008a442199c67f0de425845878c56c41e3b0e8d5384e","observation_id":"9d3a3448-bd1f-4dd3-9b1f-e59ec1e1b857","resolution":{"observed_at":"2026-08-07T00:34:08.876205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T00:33:56.124755Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.124755Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3b33ee6bcda64e82c1a5bf0a9b01f8f1d5be17d426824cc1f836d1b64d5ef3df","observation_id":"335a85c3-ee6c-4059-8461-65bf81add525","resolution":{"observed_at":"2026-08-07T00:33:56.124755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-07T22:31:04.523671Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-07T00:33:56.251004Z","title":"Image textualization: An automatic framework for creating accurate and detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.251004Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6970ecb3232000b67eb0d9d7bf4cdb9a215cd39049bb6c50af27b8e32ed03976","observation_id":"8ff8a13b-870f-4430-9788-4a5a244680df","resolution":{"observed_at":"2026-08-07T00:33:56.251004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"cited_work":{"arxiv_id":"2502.09051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09051","snapshot_observed_at":"2026-08-07T00:34:04.453845Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","venue":"cs.CV","work_id":"f68d3fbc-385a-4f04-9db8-86f728895910","year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.525727Z"},"links":{"cited_paper":"/paper/2502.09051","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d26575b3280ea01c56fe602390c0e5bac3bb4c863e8accdbc23e158333a00fc8","observation_id":"7d51a540-97a0-41d0-9202-02ef0d0b3ea4","resolution":{"observed_at":"2026-08-07T00:34:04.544547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T00:33:56.665520Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.665520Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:723070c3cf9669ace2db4c9234423422195c6d7a69b709e5913c510c26cdf699","observation_id":"5f4fd0b5-7eee-4cc1-92ea-93643c245a82","resolution":{"observed_at":"2026-08-07T00:33:56.665520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T00:33:56.770706Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.770706Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:77207ee743eab13fe12a4a3d78264724ec682b4860328093fadad811806cfd45","observation_id":"4dc8e471-1f47-4447-9f08-d0e01cf6afef","resolution":{"observed_at":"2026-08-07T00:33:56.770706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T00:33:56.851632Z","title":"Regularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.851632Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:7fb5816058e44007acc03c209830ae4e21717abdb582daf1789cf526ce664695","observation_id":"17375a3c-39b5-4c5f-93b5-1113f5dbca4a","resolution":{"observed_at":"2026-08-07T00:33:56.851632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-07T00:33:56.965198Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.965198Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1b2a3c5ad0699f22665ceadfb2c674393e572f0e3b61df47af44ada03c153bc0","observation_id":"712e93bf-a4be-4b77-8f3b-32299be42706","resolution":{"observed_at":"2026-08-07T00:33:56.965198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T00:33:57.076467Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.076467Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:ea57db4f66e2275c8d46dba25e4922bfdf70ee1d8288aae630e74f6a64547dc2","observation_id":"97ee5a45-5a24-47aa-8ddd-27be7773c5e7","resolution":{"observed_at":"2026-08-07T00:33:57.076467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.401451Z","title":"Chi, Quoc V","venue":null,"work_id":"5a57e781-b988-416c-8710-35658d75965f","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.145526Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:39abeb23b27e5c4da7b2695ed13310a9ae8f879a2cbce18076b922271111e252","observation_id":"3af1a78a-4148-4762-8f6b-41e1dcaeab74","resolution":{"observed_at":"2026-08-07T00:34:08.485421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.337884Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.337884Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:2a145afaf62eb156bc12b25f89c9a046839bb3de4146725bb87fb8c7fe47c5d3","observation_id":"7300f65a-3223-421e-b689-8e8ecc2a5f18","resolution":{"observed_at":"2026-08-07T00:33:57.337884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:08.104735Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection, 2023 a","venue":null,"work_id":"f8eab864-7633-4d82-9b83-785a8eaaf562","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.515024Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:79f2d9a17dd6f00eb9ca0868c0c78382941b11539fb05d01217da5fc3ebd251f","observation_id":"c92ff6c1-a64a-4505-b622-bf0e88232d6a","resolution":{"observed_at":"2026-08-07T00:34:08.231425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.605814Z","title":"Detectron2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.605814Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c3f08ac3c6468305a422a3fc6a9c6d13a11c10f71e9aa0369670a603a45b4c66","observation_id":"2fda5150-1f12-4cfd-a2f9-b595027bccb9","resolution":{"observed_at":"2026-08-07T00:33:57.605814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:33:57.696410Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.696410Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:96e63fc395561fc9ad3b50a1882709e32eac3053b64ae85f93f517fc54dd66ea","observation_id":"057fb7c3-9c81-49c3-aff1-b0695aace441","resolution":{"observed_at":"2026-08-07T00:33:57.696410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:57.824861Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.824861Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:0584e0ece385775ee24f90fe60ce92d5ce6c7fd1ce56d0f3d6c6df402ee69ca1","observation_id":"9234ae8b-c117-484c-82ca-a7c707cd8634","resolution":{"observed_at":"2026-08-07T00:33:57.824861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:33:57.925619Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:57.925619Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6ab5d80c0478d6e6453fb4273c89d85dbfd5b899847e55e92189da04162800c9","observation_id":"aeb1c785-afd8-4663-972e-468a808ab679","resolution":{"observed_at":"2026-08-07T00:33:57.925619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.089473Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.089473Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9ab673355206f4291bcc8ec1f9c89e32017b70bcf86c51356b2d6d8c735fba07","observation_id":"16ab5fe5-b16c-4bf7-adaf-8a74df19abd2","resolution":{"observed_at":"2026-08-07T00:33:58.089473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T00:33:58.204744Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.204744Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f7565a61211f1ac89c1f886cfecb9497d2848a4f484b115c301b3658a1e7f47b","observation_id":"3aea31ff-d467-4ea0-a473-3a36fc822df8","resolution":{"observed_at":"2026-08-07T00:33:58.204744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.711348Z","title":"Gemini: A family of highly capable multimodal models, 2023","venue":null,"work_id":"1d3db0f0-9b72-46aa-981e-4de307d3e457","year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.323913Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9b4fc3bb7ad28083c9138dd3f35d9252c74fadefd184666cb8e1c7f738bd42e0","observation_id":"4f756b18-5c6c-41e2-a79a-6dc72c1eeef7","resolution":{"observed_at":"2026-08-07T00:34:07.881904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.494189Z","title":"Visual instruction tuning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.494189Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:83faa99b9de2d99ea511784efe2c6788c8d41a30a5dfacbf9090288a0d8151cc","observation_id":"1d6f752f-6ec1-4570-a9c9-00d766f05db2","resolution":{"observed_at":"2026-08-07T00:33:58.494189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.598937Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.598937Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d499dcd1210fd707c6d8f57d94716c29568a189fbbd15b43c908a04d49dbe61c","observation_id":"c78671b4-f52e-4dc0-941e-2810b163f8bf","resolution":{"observed_at":"2026-08-07T00:33:58.598937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.420269Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding, 2024 b","venue":null,"work_id":"9252df0c-51e5-494a-9aa2-e7553435be93","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.678265Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4261d61d0eb4bcb2fce6eb5a523045c4827870f142d4cfb6c860c6d3cdf73c93","observation_id":"eab265e1-d15b-4880-8499-3ffa908e199d","resolution":{"observed_at":"2026-08-07T00:34:07.546774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:58.820250Z","title":"Sharegpt4v: Improving large multi-modal models with better captions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.820250Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:1706494f3bf601081402a0b43fd1f60a7ed3f2fcaa8d1dcd9711ea1e7f780791","observation_id":"a0a66828-c668-484e-9de3-7be0787a80b6","resolution":{"observed_at":"2026-08-07T00:33:58.820250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:33:58.895296Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:58.895296Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8c29457b0fec04656c87982188c4309d2043e33cb3ca76bc53fae2d94afa072c","observation_id":"5f8b388e-d3b8-47ef-b393-3048f178eb6d","resolution":{"observed_at":"2026-08-07T00:33:58.895296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:59.109451Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.109451Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:00f489371e5ca78a7379b3fbbad9076bf85de1519b2b935ab38b1457729135b9","observation_id":"17ff4a32-4028-4ef3-be13-82cf82910833","resolution":{"observed_at":"2026-08-07T00:33:59.109451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:07.032048Z","title":"G-detkd: towards general distillation framework for object detectors via contrastive and semantic-guided feature imitation","venue":null,"work_id":"8da302f0-23ae-47cc-83fc-35bf2e8c4b28","year":2021},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.257399Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d8920dead22fa9db746d7f3aa22177d9f4bd3c90511a32c4e8a1532182ae11c6","observation_id":"90a65f8b-979b-4f87-a34a-38dbe01c0037","resolution":{"observed_at":"2026-08-07T00:34:07.130882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.743868Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"806afe01-4473-4785-a419-06a15c143649","year":2020},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.466805Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8a2462ae2d428cf4aa8eb15d396a49faa98f2a8849bb0d4de81328c1324133f1","observation_id":"659a3a35-0423-48d6-bed4-51a35d4dcdb4","resolution":{"observed_at":"2026-08-07T00:34:06.837984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.582006Z","title":"Global-local path networks for monocular depth estimation with vertical cutdepth, 2022","venue":null,"work_id":"03381351-3791-4ec9-a8ab-998743095d18","year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.614342Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3f90dd2416cfdb4cf760aacde451e01a12a846d49137cd3fe74a444c288d9401","observation_id":"06efcf38-7a97-4ae5-bb33-b0c38f04a6d6","resolution":{"observed_at":"2026-08-07T00:34:06.645786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:06.294533Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data, 2024 b","venue":null,"work_id":"9a1e5835-dfce-4f88-b96f-6452ddf61af9","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.733953Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:3e84992643a3df00bcadf5823e740f47340139fdf4b119e4efcc71d55be664ce","observation_id":"32f16727-5973-4eb9-8a5b-ef19c1b28cf6","resolution":{"observed_at":"2026-08-07T00:34:06.408486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T00:33:59.917204Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:59.917204Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:73e8a6696b2ebeceee1887ad5ffa4b28672ba24617f772d02eb937d8dbc71c58","observation_id":"703dd32b-d862-4d7e-af01-9adb8b00d82e","resolution":{"observed_at":"2026-08-07T00:33:59.917204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.930107Z","title":"Detclipv3: Towards versatile generative open-vocabulary object detection, 2024","venue":null,"work_id":"29f9da7d-7b10-47f4-894f-b202883f0889","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.069034Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d905c68cd16a3f409536d24542155a842ad06a54448a3ecea75832ca69059429","observation_id":"d1bed38f-3a46-46f3-bd26-4df047435b01","resolution":{"observed_at":"2026-08-07T00:34:06.072509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.209577Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.209577Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:aca388d9c0c6e43fa24bcdad7395c77f99925f0c20505b635411bf7099189a70","observation_id":"9b653fa4-3b63-43c8-aa2b-e9166cfb4795","resolution":{"observed_at":"2026-08-07T00:34:00.209577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.313903Z","title":"Entropy-regularized process reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.313903Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4a95a0c743d6e8612a61b9f076b75c2a850e2d49e0d7423ab9d96187f997c8fb","observation_id":"1273b247-f85f-451a-b5ce-456753c43268","resolution":{"observed_at":"2026-08-07T00:34:00.313903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T00:34:00.459775Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.459775Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d8b9418f3bc7194aaddf287eb60b7a6f2dbebcc35a704ed43016785383e5773a","observation_id":"cfe08292-f8f5-4f7a-8ffb-56766c46e2ec","resolution":{"observed_at":"2026-08-07T00:34:00.459775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:00.538427Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.538427Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:c41829071f245fdcb20da043f0e7784f55e571077a9e34c95c3ba505ad119ba1","observation_id":"175b940e-df21-424b-bd9e-dc08f0673f5b","resolution":{"observed_at":"2026-08-07T00:34:00.538427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T00:34:00.668832Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.668832Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:15aa19af8ccf89b20ce08f67ed83bffede3a49916e79f4d322ab1641fbcabff0","observation_id":"e3a2a723-284e-4cfc-bbcb-7508e1d319c5","resolution":{"observed_at":"2026-08-07T00:34:00.668832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T00:34:00.772326Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.772326Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:16f97981e635f0c276ac368cbcafb9bd2a3cd91546db06c24e78fbcebfc50b6a","observation_id":"41150ab9-a1a5-455d-a39a-e2ed661c1a3d","resolution":{"observed_at":"2026-08-07T00:34:00.772326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.597299Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":"70be157f-c55a-4d41-b220-83fe86721c11","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.898171Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:6102195ddfa8335f09d51dc7a7f2e1f4adff90e211dab38003491fd416b2891e","observation_id":"46d38e64-5e7f-4d8f-996f-544aef9cdf00","resolution":{"observed_at":"2026-08-07T00:34:05.689725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.354808Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024 b","venue":null,"work_id":"58e9cb10-b97c-44ca-b9e9-8feaea5c6393","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:00.997086Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:40570ee4ef3bbf7544d10feff35b9ffc83f3a7980a12abaf1601d7e55fc62d0a","observation_id":"0f6a21d9-2b56-4249-b0d4-f50e735f049f","resolution":{"observed_at":"2026-08-07T00:34:05.457636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:01.254752Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.254752Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:dd1fae61ffdbc4246e1a72e251ba5db47afdbed7ca8374041cf5d5735dc51496","observation_id":"7b990001-6d13-4f8f-91b7-b7665f47f180","resolution":{"observed_at":"2026-08-07T00:34:01.254752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-06T16:39:25.477229Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-07T00:34:01.366014Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.366014Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:0e5f3da6edc693d3a90473112c50dc8d1a21b6ba3cd22082c53c05a384154f3d","observation_id":"4cf8f6cb-6683-4aa0-95ff-b22f40faa089","resolution":{"observed_at":"2026-08-07T00:34:01.366014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:05.056399Z","title":"RlHF-V : Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"8abbadf0-5414-4c1f-810f-5cfcc4130019","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.535272Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:ed1f2b0abea8882ac4c9c4bd7d94691f56983a11a8657f5a1d936bda6f95a0b0","observation_id":"9f24e489-e291-46e5-b7ad-b4a4f303a15c","resolution":{"observed_at":"2026-08-07T00:34:05.131722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T00:34:01.674745Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.674745Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:8f86127e2c32420fb5046e68798c835a040235ec86490c27cfadf07f20d1c48c","observation_id":"68bb5824-4ba9-4039-b49d-1727dc6a549e","resolution":{"observed_at":"2026-08-07T00:34:01.674745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:04.864042Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169--186","venue":null,"work_id":"5655cd2f-631e-4906-bf2d-903143d8893b","year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.784926Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:db089daa442ffb04f1dbf4f6e3a393254ca8830da62f9cf9d41fc6a406854f19","observation_id":"a725c543-89c3-4ae7-8a4a-e3e1d6d57199","resolution":{"observed_at":"2026-08-07T00:34:04.935766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05318","last_updated":"2024-10-05T05:21:48Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-05T05:21:48Z","title":"Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05318","snapshot_observed_at":"2026-08-07T00:34:01.910015Z","title":"Improving llm reasoning through scaling inference computation with collaborative verification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.910015Z"},"links":{"cited_paper":"/paper/2410.05318","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:5993796efed670dc55b5434924d699dc81e3490c75f5768132e4fc5778c2f02c","observation_id":"497b1613-5f52-448f-88a8-1645b6bba42e","resolution":{"observed_at":"2026-08-07T00:34:01.910015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-07-06T17:28:02.037844Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-07T00:34:01.982398Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:01.982398Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:2a3bd432c498eb3f4a4229e50f62619162c797dacccf256100d7de87d3d0da1d","observation_id":"10b8cb74-dedb-4513-bbb4-17d9cd73fdbb","resolution":{"observed_at":"2026-08-07T00:34:01.982398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:34:02.117511Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.117511Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4ebc9f9aa5a566e84119f5dce2555b5af1e23e369bf0baa53683b33048371b61","observation_id":"964dcb89-b750-40de-87cb-9f150da3de60","resolution":{"observed_at":"2026-08-07T00:34:02.117511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:34:02.276771Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.276771Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:cfb28720caae5ebffa9070da13d6a7bb4decd8eafb4cba6ca835057a2ab630b6","observation_id":"baff011b-f8e4-49ec-ae43-3ddf46008b7a","resolution":{"observed_at":"2026-08-07T00:34:02.276771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.392041Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.392041Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:29079b93f08baf4d5223ce1f7d4a7bd54fe799d176e5864fcaf2d21f9c831dd1","observation_id":"54846322-0400-41c2-bddf-a584ee6cdc9c","resolution":{"observed_at":"2026-08-07T00:34:02.392041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:02.549287Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.549287Z"},"links":{"citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:361651ec431aaaff0b4b01f175da162eddde8e85d5b4fff4baf588cc15d0c048","observation_id":"c4f294e2-d043-4c98-983d-e5fd7e3cea53","resolution":{"observed_at":"2026-08-07T00:34:02.549287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:34:02.661492Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.661492Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:0927276bd7ca44139966e9f19bc4b3b1462f3a63a16227aa580dee0aa4b48fb5","observation_id":"a18b81a1-3763-4337-ae71-4ba9b7ef5f7e","resolution":{"observed_at":"2026-08-07T00:34:02.661492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T00:34:02.816427Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.816427Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:b3659b34957521acdc0510e42dddbfed1b595883442409812cc4f5890292ed17","observation_id":"ced36032-cf5c-4953-9d69-a793bc53113a","resolution":{"observed_at":"2026-08-07T00:34:02.816427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T00:34:02.960724Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:02.960724Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:55b40cd09d6489abcf85986f8f7c980f4ac1587d66d0eb09482be9741da51030","observation_id":"210b0553-5bec-4d76-9353-5a32a79b2165","resolution":{"observed_at":"2026-08-07T00:34:02.960724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:34:03.076564Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.076564Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9cc969a6e97d118b525da3d384568efe8b9f0e301eefc55185e3dada10332f78","observation_id":"d45607f7-0eeb-4f4a-9271-0dce9d0007ae","resolution":{"observed_at":"2026-08-07T00:34:03.076564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T00:34:03.216795Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.216795Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:97cf13889e18d0831c91696ca7402e64253561be165caac7fcb324931360754a","observation_id":"456f258d-cdda-45e3-a431-c54fb8de5b8a","resolution":{"observed_at":"2026-08-07T00:34:03.216795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:34:03.367306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.367306Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:f5a8ae1ac263537a0bf2e01162a9e576eadca17e245e9c1cd4b093e7792b61bd","observation_id":"5876a8e5-1de7-487e-a2b7-ebbc8f195b8b","resolution":{"observed_at":"2026-08-07T00:34:03.367306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2506.13888."}