{"as_of":"2026-08-08T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8eb56eedc7a7488a4c7cc3afeb92e278b18132588985a974d10669dde8daa97","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:11:33.916383Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:06:15.623188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:26:28.843655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2509.06759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06759","snapshot_observed_at":"2026-07-02T03:26:28.843655Z","title":"Yuqi Niu, Dilara Keküllüo˘glu, Weidong Qiu, and Nadin Kokciyan","venue":null,"work_id":"af5e5365-25e2-458b-96c2-2cbdd47203a2","year":2026},"citing_paper":{"arxiv_id":"2606.03604","last_updated":"2026-06-02T13:09:04Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T13:09:04Z","title":"Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:06:15.623188Z"},"links":{"cited_paper":"/paper/2509.06759","citing_paper":"/paper/2606.03604"},"observation_digest":"sha256:4295d5a4da8479585caec651753e00569df8590bf46a64c48581d70cdd2a2935","observation_id":"f4c65fd8-781c-4f7a-88f2-3b0a19ee93ef","resolution":{"observed_at":"2026-07-02T03:26:28.845645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06759/citation-record","integrity":"/paper/2509.06759/integrity","json":"/paper/2509.06759/citation-record.json","paper":"/paper/2509.06759"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.756011Z","title":"Visual instruction tuning,","venue":null,"work_id":"0599618a-d9c2-44da-ac20-411990a2f4c2","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.712782Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:f59aa1fd49539f1f7050dab6be7724d9b1b91471cdc197b2c112889a69c16afc","observation_id":"0b7ddbe5-6805-4d44-8d87-936c0c175228","resolution":{"observed_at":"2026-08-04T23:11:35.758397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.746960Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":"5aa763e7-11d6-430d-9591-69c6e8a9ebb5","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.810781Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:cce086bcc6cca9b9777ada8c9c11eec643352ed26f8e888456edee3d0c47b5dd","observation_id":"82d881f1-e063-4db4-87d4-7c06c0718ac1","resolution":{"observed_at":"2026-08-04T23:11:35.750942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.738443Z","title":"FuRL: visual-language models as fuzzy rewards for reinforcement learning,","venue":null,"work_id":"ab65a0f5-60af-4015-8c50-c5a3baf7c8db","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:29.936043Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:a5c840e1554267bffddfd816002cdea230fdda8fab8cf619f32b654a19fcdbbd","observation_id":"a9705884-29bd-481d-ad90-0883b4698e2a","resolution":{"observed_at":"2026-08-04T23:11:35.741768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.731237Z","title":"Direct preference optimization: your language model is secretly a reward model,","venue":null,"work_id":"60737735-5a08-4f76-9bea-0d051bca0b78","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.083034Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c65e35cb9e0d0f81180527f396bc85f52538ef168bb530f284c29b8e0f06057e","observation_id":"285986a1-08cd-473a-b33e-adbfa20b63a4","resolution":{"observed_at":"2026-08-04T23:11:35.733910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T23:11:30.185541Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.185541Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:73963b0566336c85126f9cb1567fc42f80bb2f88516d29f29b16abfc212d4302","observation_id":"937d651a-f762-4345-9648-4634aaeccb1f","resolution":{"observed_at":"2026-08-04T23:11:30.185541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:30.327881Z","title":"Deep reinforcement learning for cyber security,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.327881Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:914703698dc8fae6d645e05c0a21b9417ecc352c7092d318769323ea41eb0d93","observation_id":"81e810d6-b6a1-4164-b624-1301cfb1878b","resolution":{"observed_at":"2026-08-04T23:11:30.327881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T23:11:30.433159Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.433159Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:4074c7416ea63078678e61adf9e222dfbfc0b3eba2f0ac4ae7b7f1d48f987376","observation_id":"2530fe82-4bf8-404e-b646-29e7b055609f","resolution":{"observed_at":"2026-08-04T23:11:30.433159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-04T23:11:30.555836Z","title":"Vision-R1: Evolving human-free alignment in large vision- language models via vision-guided reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.555836Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:ff5591e1e451d58616400d897c63883cf7ee995225a4f3c9e74a286eff892bbf","observation_id":"5eb4008c-f784-4649-a0cc-4dd41817ff9d","resolution":{"observed_at":"2026-08-04T23:11:30.555836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.719905Z","title":"GPT-4V(ision) System Card,","venue":null,"work_id":"851263e0-b20b-4337-a696-b19149402635","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.681453Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:62dce6c5c67172377995576388f602b7c7a9c8ece5323ae1390fd588068b11c1","observation_id":"96de6b97-b3f9-44e5-8037-ad88ddfeb846","resolution":{"observed_at":"2026-08-04T23:11:35.722313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T23:11:30.789285Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.789285Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:88c64597ab6048d5600f94edbc7f21a6ed13d1ecac6ed24cfc3a89c095a14e53","observation_id":"f32b6995-f3cb-4e21-a4d0-c354ea1c84f7","resolution":{"observed_at":"2026-08-04T23:11:30.789285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.712523Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku,","venue":null,"work_id":"e1ca7096-864a-495c-89ba-2340e291d7b4","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.892892Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:a65ff597cc9671c9db2e93a477219d801285b369f5c0d24910b8670dc1b1d770","observation_id":"2b2055ae-7013-4777-aa96-0396d55ff61c","resolution":{"observed_at":"2026-08-04T23:11:35.715410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T23:11:31.049107Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.049107Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c7269ebf3bd45d79900e888db234307c85231c74bc4d0074d88e20dc34089ae4","observation_id":"d4d1a607-5086-4fe1-8c10-dd42cd967546","resolution":{"observed_at":"2026-08-04T23:11:31.049107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T23:11:31.172246Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.172246Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7cb8ef33ddbbee45461f9d695c5f92ad6ec58cfaa6827452b89137afc5ea35e4","observation_id":"c7afd6ff-f37d-48fc-8971-c23572d2a6f2","resolution":{"observed_at":"2026-08-04T23:11:31.172246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T23:11:31.322246Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.322246Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:2d7da50257ee429505cb0b8b3560af6e8d7792b7d28105731ec4d413b0f63bfe","observation_id":"06c642ba-e757-4f1a-b582-dd08acd688e4","resolution":{"observed_at":"2026-08-04T23:11:31.322246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.704736Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,","venue":null,"work_id":"16f08e1a-3a39-4b2d-be06-771defb0e7f5","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.455348Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7c79922b8f2012710fc5d3d4dee4360973ceca6a05a9eb5d4ef5597e97aca921","observation_id":"6dea6216-c277-41e8-8d9c-deff99a9c82c","resolution":{"observed_at":"2026-08-04T23:11:35.707253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.694491Z","title":"Aligning large multimodal models with factually augmented RLHF,","venue":null,"work_id":"f0ee5e8d-2212-4caa-83a0-b57da5870630","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.557083Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:5e0f2fe22a66bd5e612c48cd88d26e38a8da7aa70896bc89bb78f6e0ce613d28","observation_id":"05d60a77-9a45-47f1-aa8b-e5d7ef872968","resolution":{"observed_at":"2026-08-04T23:11:35.697317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.685903Z","title":"Fusing pre-trained language models with multimodal prompts through reinforcement learning,","venue":null,"work_id":"1b84d73b-5011-4f73-851f-a783d2a0f514","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.659056Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:5b696c25c28e9410e335cc60e1ffeb0f724a4120192099c6d7568dacd9a936f6","observation_id":"5515cda2-59b6-4b31-9a73-4a4ed8eef351","resolution":{"observed_at":"2026-08-04T23:11:35.689442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:31.774303Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.774303Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:75bf12b3a9832962ad29484ffc14c46356bd22101d58c3cccdb5be783dc165e1","observation_id":"eca955ef-ec96-4f6a-bc04-9842a5ae3694","resolution":{"observed_at":"2026-08-04T23:11:31.774303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-06T21:08:23.353594Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-04T23:11:31.875241Z","title":"Improving vision-language-action model with online reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.875241Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:13e4428ee17643bd69d5e7c67f4adff58f09a1c15133e17b374f066d8f778d57","observation_id":"2725aca8-5c7c-48f3-8fbf-57cd903c3e8f","resolution":{"observed_at":"2026-08-04T23:11:31.875241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.675663Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning,","venue":null,"work_id":"0096c954-61c0-4e0e-b939-61e82c482125","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:31.972932Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:816dcdcff3bd3bb5e8e7459801c413af85d616ce415e2589378b12eb5102958a","observation_id":"584d7002-35ed-412f-885a-9e1b337db0e4","resolution":{"observed_at":"2026-08-04T23:11:35.678223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.669280Z","title":"VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,","venue":null,"work_id":"08358edf-ef86-4b76-ac56-a4fba6b20a76","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.078379Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7bcdd60a4b7a75de358224a22840fddb5788f9b3b8ee5d5bc79c193f24e69f1c","observation_id":"9dd998c8-ec99-4eb2-951b-5774943f28c6","resolution":{"observed_at":"2026-08-04T23:11:35.671740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-04T23:11:32.187646Z","title":"MM-RLHF: The next step forward in multi- modal LLM alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.187646Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:389662a8afe93702eca50eb1117d1db53e90a33eb87c906e9658daa84617dbbc","observation_id":"1e71b9a7-b5a1-432e-9845-65efc072eef0","resolution":{"observed_at":"2026-08-04T23:11:32.187646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-04T23:11:32.319995Z","title":"Insight-V: Exploring long-chain visual reasoning with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.319995Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:6498e19c41fc33113c9b47b35547f67dd04c482f7365596fb67c582b83a6c725","observation_id":"d62c896b-9f3a-4713-8d08-1799de8b65e5","resolution":{"observed_at":"2026-08-04T23:11:32.319995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.662617Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":"a346d3e7-b712-46c2-83da-242317f3fc40","year":2022},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.400862Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8196b233976d19e98f37dee87796becd4fdcfe9bf0252fcc88bed05d1c2e5466","observation_id":"73f1b11e-3aba-4ab6-9a34-d35332c2bece","resolution":{"observed_at":"2026-08-04T23:11:35.665282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.656135Z","title":"RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,","venue":null,"work_id":"5dcb6782-fb40-4812-b557-8dd97bd441ff","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.459930Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:99228217cfdb476244edf358176fc70316db51b48e6e83418b051626461ef91c","observation_id":"dd0286eb-b055-4f36-99dd-9cb8bb277b00","resolution":{"observed_at":"2026-08-04T23:11:35.658696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:32.518338Z","title":"RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.518338Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:205680517bbb42cd836fd9fa415c88ab6acefb23cc08f2fa95602c456f079dbd","observation_id":"1ed9281b-9ea0-449d-809a-5428edc78ccd","resolution":{"observed_at":"2026-08-04T23:11:32.518338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-04T23:11:32.623370Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.623370Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:3fee39267ef90bba772324514661ec2bd2e553a8d7d9ea35741288999fbb2a8f","observation_id":"9c0e0dba-87fe-4724-8c9b-7450768ae793","resolution":{"observed_at":"2026-08-04T23:11:32.623370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.649786Z","title":"Aligning modalities in vision large language models via preference fine-tuning,","venue":null,"work_id":"1c0bcd6d-42f5-4833-9959-0dcfbdb89f0f","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.712851Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:59a1194ed4557ade6b3e268ea99797a1a65a349354771773456c5abe099deabc","observation_id":"4d9d970f-7b5a-4ed0-ba28-4912501b0c8b","resolution":{"observed_at":"2026-08-04T23:11:35.652391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.267173Z","title":"Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,","venue":null,"work_id":"4095a9c2-e172-44b4-ba84-3760a1c1ff81","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.788914Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:7b941d26c5418c78330f538eceb25a7e400e4aa4b4eb9d2e46c63b52c781baa9","observation_id":"98be5315-ceb8-4cbd-9ca8-eb2959294c31","resolution":{"observed_at":"2026-08-04T23:11:34.328168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.642049Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement,","venue":null,"work_id":"54a796eb-1761-45a7-a552-b0ad37ba3e53","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.858563Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c5bf929effde5c5fa474c72189df1b51b440a8e4a739f15969b8a2b9045dbac2","observation_id":"44d826cd-ca6d-4d51-a385-502c419dcf59","resolution":{"observed_at":"2026-08-04T23:11:35.644815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.634814Z","title":"VILA: On pre-training for visual language models,","venue":null,"work_id":"cb1a7aaa-9862-4395-8f5a-5a2b3fd8636e","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.938809Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:dabdb3874b005373402f1d89183cb676612c78d32632cdcb6065474c987ef3bd","observation_id":"340830de-37de-418f-a89a-309ae2e27376","resolution":{"observed_at":"2026-08-04T23:11:35.637399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-04T23:11:33.026717Z","title":"SPA-VL: A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.026717Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8f51fa86be1ce148a7f9f399198636e0e810f911534cb292d0689adda578cd73","observation_id":"08d7f4a5-692d-40ce-a274-cc75b88179e0","resolution":{"observed_at":"2026-08-04T23:11:33.026717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.627386Z","title":"DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,","venue":null,"work_id":"5d3390f4-1ada-457e-8183-4c5a41122518","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.113237Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:e5e0746ca504e947978c5d5368daed8df977cdf49f6b7d61f6f87de2c616faad","observation_id":"cb03875e-d4b2-4db5-be8d-34f9a673557b","resolution":{"observed_at":"2026-08-04T23:11:35.629758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.619933Z","title":"Active learning for vision-language models,","venue":null,"work_id":"45a1e003-432e-41ba-af85-f761a15efa6f","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.169468Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:77bde43b7e343f9c4ae9bf4f9265fd854dac55519716165d2c03b4bbe0b0a6d8","observation_id":"4f1bbaf7-89cd-4365-bcb9-edf78b7b875c","resolution":{"observed_at":"2026-08-04T23:11:35.622360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.611694Z","title":"S-CLIP: Semi-supervised vision- language learning using few specialist captions,","venue":null,"work_id":"759fe328-2009-42d9-871e-5955eb335f96","year":2023},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.253965Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:110f095215945fdf3c04ff2cf0ae1946d6f20f3c3f6063ca732f8a90bf71017e","observation_id":"947346f9-f031-49f6-8893-3e196311fc20","resolution":{"observed_at":"2026-08-04T23:11:35.614867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.603207Z","title":"RL-VLM-F: reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"a535c0af-f2db-410a-9814-24b29c655ab9","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.336199Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:1726736478093b41c01dd2a6db53f0736e2716c95338ce835c2d483856b20bd1","observation_id":"39cd1753-ca90-4451-b2a6-3e7b88b37ceb","resolution":{"observed_at":"2026-08-04T23:11:35.606114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-04T23:11:33.426693Z","title":"VL- Rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.426693Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:c30f2b1ead124f9ba4f370a3885810c9a03fa636bdf7ac410d91dab701c4cfd4","observation_id":"8f86d631-de35-4c62-b3b9-ab9639bc0c06","resolution":{"observed_at":"2026-08-04T23:11:33.426693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.122705Z","title":"Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,","venue":null,"work_id":"043607cf-7019-4fda-85d8-5a784d62f08c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.506496Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:e14ed7c933336b3459439df5357c938c16dba65cdc69dac83db63e4143715043","observation_id":"50ab2a2b-223e-4db1-a473-b074a11bb0f2","resolution":{"observed_at":"2026-08-04T23:11:34.192544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.324334Z","title":"Zero-shot model-based reinforcement learning using large language models,","venue":null,"work_id":"d8b603f6-29c8-4a1b-aace-a95625db8abe","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.588219Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:f30ae6ea1a6bb02032578c520f03be998ad6edcf421aa013358ed9186114c4a3","observation_id":"275b609a-a0c7-4d8e-87f6-14be0bb1e33e","resolution":{"observed_at":"2026-08-04T23:11:35.492893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-07T17:17:34.989308Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-04T23:11:33.680238Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.680238Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:ec5b46ea71368a4c8c7b60a7ac1091828e3572d12605b72effd04cdd7dd37189","observation_id":"81da2cfc-2953-4d37-9707-0803e844cfca","resolution":{"observed_at":"2026-08-04T23:11:33.680238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:35.057573Z","title":"Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,","venue":null,"work_id":"f6def88b-bb57-40fd-b072-f24e2869bbdf","year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.749871Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:76c0b10eac3bcce8c736819e8618f43ac52d553bf7ecbf49aaf8ae6be475836d","observation_id":"fb608950-511f-4461-ab83-d883d128b16e","resolution":{"observed_at":"2026-08-04T23:11:35.213474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11918","last_updated":"2025-02-17T15:32:14Z","snapshot_observed_at":"2026-08-07T18:12:03.155464Z","submitted_at":"2025-02-17T15:32:14Z","title":"VLP: Vision-Language Preference Learning for Embodied Manipulation","version":1},"cited_work":{"arxiv_id":"2502.11918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11918","snapshot_observed_at":"2026-08-04T23:11:34.018548Z","title":"VLP: Vision-Language Preference Learning for Embodied Manipulation","venue":"cs.LG","work_id":"c35d4c6b-2259-4cf5-a9e2-5fe816ef0f9c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.816944Z"},"links":{"cited_paper":"/paper/2502.11918","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:17a43d8775307ac7c5aaa77f70aeae7868facfa29cc4cbd67bcdda7cb12000d3","observation_id":"b37a8033-2b5a-4f9b-b754-91d30b904049","resolution":{"observed_at":"2026-08-04T23:11:34.055141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.765698Z","title":"Multi-agent deep reinforcement learning with human strategies,","venue":null,"work_id":"eb947412-8886-4f15-8b11-e724cb75bbeb","year":2019},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.871306Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:b641edf823b8bceabba377f091032f0e20e9827199366498858eb13ca3c1b615","observation_id":"c0650d6e-0169-4640-a19c-fd7cc2086343","resolution":{"observed_at":"2026-08-04T23:11:34.879301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:11:34.533727Z","title":"ETA: Evaluating then align- ing safety of vision language models at inference time,","venue":null,"work_id":"f6936193-05ec-4155-9b16-3b9a21d6f93c","year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.916383Z"},"links":{"citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:f88d3955054e03f8f0a2c9bb155ba9f01a3a68fb278a86fcdfdee6ec3a4dfbcd","observation_id":"7336f9a6-1f18-42b4-a64b-401378996dcb","resolution":{"observed_at":"2026-08-04T23:11:34.656421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.06759."}