{"as_of":"2026-08-23T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f48dea607eda152b29a5b1a6e98eef24200625b4e9626da391cc832416685cb","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:23:50.744223Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:28:02.977973Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.082400Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-10T22:17:23.962027Z","title":"Mm-rlhf: The next step forward in mul- timodal llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-20T17:46:54.459933Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"reference_index":266,"source":"pdf_text","source_observed_at":"2026-08-10T22:17:23.962027Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2501.02189"},"observation_digest":"sha256:332f72a3554a7cbe3a42916f818a68be27fcb87f401566421337f756cc49ae12","observation_id":"6617a416-055b-4156-8a1b-15a070b0c255","resolution":{"observed_at":"2026-08-10T22:17:23.962027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-20T08:13:05.630967Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":283,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:6d7bcb109a1231c5494d7df2be1e9db4c1f2331d41d56620f15c435806336801","observation_id":"da679117-4f8e-4591-b954-03f590d5c904","resolution":{"observed_at":"2026-05-13T01:36:24.493833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-16T12:28:02.977973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12749","last_updated":"2025-04-17T08:41:23Z","snapshot_observed_at":"2026-08-20T01:50:33.152149Z","submitted_at":"2025-04-17T08:41:23Z","title":"LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:28:02.977973Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2504.12749"},"observation_digest":"sha256:37bf451d4c9c3ae24792eb72dd6b5478b3985e5ffe28342e2665042e6f04da50","observation_id":"f7f675fc-ef38-4d3a-9d70-8a0f7dac1cb9","resolution":{"observed_at":"2026-08-16T12:28:02.977973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T14:34:55.253963Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-18T23:16:30.035453Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.253963Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:6eaf719249e473c6a9ecd204e20c176595e0256249ff1db75046839a67a276ee","observation_id":"ae56dbab-7a2e-43bd-8dcc-caf3f8bb724f","resolution":{"observed_at":"2026-08-07T14:34:55.253963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T12:42:19.926347Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23977","last_updated":"2025-05-29T20:08:36Z","snapshot_observed_at":"2026-08-14T07:15:40.007800Z","submitted_at":"2025-05-29T20:08:36Z","title":"VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.926347Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2505.23977"},"observation_digest":"sha256:a9badbfa84fb9e049c030e1d6b58e923cd101068c30c0d98e95fb209afff7613","observation_id":"d5852424-7ed5-485c-ba4e-571f5d9b5900","resolution":{"observed_at":"2026-08-07T12:42:19.926347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T11:55:14.702270Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-21T17:42:03.698763Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.702270Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:35b743053047aba122845f3e2f967eb1fd80f1ffa5c9ee380ca0e987b5eb6f96","observation_id":"af67a684-595c-4119-b025-89b1851ed955","resolution":{"observed_at":"2026-08-07T11:55:14.702270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T11:21:40.615790Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02726","last_updated":"2025-06-03T10:36:38Z","snapshot_observed_at":"2026-08-10T14:38:31.928986Z","submitted_at":"2025-06-03T10:36:38Z","title":"RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:40.615790Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2506.02726"},"observation_digest":"sha256:0981b45b391709ad34765df4c13fe51f8a737bb10a96c4cd46808d957e40d5c7","observation_id":"9b0ec985-fb2e-429e-bbeb-c23793eb36c8","resolution":{"observed_at":"2026-08-07T11:21:40.615790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T11:22:50.342524Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05384","last_updated":"2025-06-12T16:38:10Z","snapshot_observed_at":"2026-08-13T19:49:04.575670Z","submitted_at":"2025-06-03T10:11:51Z","title":"Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:50.342524Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2506.05384"},"observation_digest":"sha256:437822453d96c5ac2e54d5c166a66891e968f3a17da85e1e8a536fb8a6bc5cb9","observation_id":"bf83dd4e-5a6b-4fe9-b9fc-de3de6805c90","resolution":{"observed_at":"2026-08-07T11:22:50.342524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-06T21:02:42.531667Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-19T15:33:39.402884Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.531667Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:fe1d07b4e80f60579646a5fc70b20570a40ea4e8c780328d9dc523c8d5031fef","observation_id":"7508d138-a168-4880-8c5b-b1f4a844fd42","resolution":{"observed_at":"2026-08-06T21:02:42.531667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-05T20:28:54.913563Z","title":"Zhang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-20T01:25:29.959449Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:54.913563Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:4d5134d8cfd6d4610139331f5cb76b78d8c7d6aa54ff931146573d0f03a3cc5f","observation_id":"ad249ce9-44b4-4525-ad20-ccc919238823","resolution":{"observed_at":"2026-08-05T20:28:54.913563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-05T13:24:39.964837Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.964837Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:c617bde5e0444d7777a295a2a5793b8cb50fac9725ec11d43aa853f91b3f6656","observation_id":"9d7afc8e-51e1-4898-9593-28a73edb2c14","resolution":{"observed_at":"2026-08-05T13:24:39.964837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-04T23:11:32.187646Z","title":"MM-RLHF: The next step forward in multi- modal LLM alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-15T23:09:31.158053Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:32.187646Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8abc168b1bead3dcd5b2c3c2a559137fa90c545af7529c6ef0dc151c879568ea","observation_id":"1e71b9a7-b5a1-432e-9845-65efc072eef0","resolution":{"observed_at":"2026-08-04T23:11:32.187646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2510.21122","last_updated":"2026-04-07T14:13:33Z","snapshot_observed_at":"2026-08-12T16:09:53.216406Z","submitted_at":"2025-10-24T03:23:34Z","title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T04:39:58.296388Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2510.21122"},"observation_digest":"sha256:bd51e01f7f154dbf4f395869b96905808f1103afef494043122a922b46203cb9","observation_id":"91815a4b-498f-4e7f-a4c8-c2af1f570f6b","resolution":{"observed_at":"2026-05-18T04:40:53.024462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2604.12424","last_updated":"2026-04-14T08:15:44Z","snapshot_observed_at":"2026-08-15T02:00:35.039791Z","submitted_at":"2026-04-14T08:15:44Z","title":"Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T15:17:39.344348Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2604.12424"},"observation_digest":"sha256:66186c8dce01e1bb169d6b839df41acd03999ea167ce2d5641a921514ed4d597","observation_id":"4fd40dad-e259-44af-8477-a5422eadcb23","resolution":{"observed_at":"2026-05-11T10:51:03.556344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2604.18091","last_updated":"2026-04-20T11:08:33Z","snapshot_observed_at":"2026-08-12T16:30:36.370390Z","submitted_at":"2026-04-20T11:08:33Z","title":"Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:33:20.557526Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2604.18091"},"observation_digest":"sha256:1e787db0e6f204e54c88d40adb0cf0ae03ae909107dd717af2fb7236c92a752c","observation_id":"8d23e198-328e-4f1d-82ac-3dc0cd04cfd3","resolution":{"observed_at":"2026-05-10T05:36:01.826529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:763805723ec138ef8bc79b5d0e886b5f0a15c715b7a3b4b6c254882807d55685","observation_id":"dd93ae88-6690-4b52-b09e-642ad95b154e","resolution":{"observed_at":"2026-05-11T13:46:04.467982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-08-14T13:14:10.140627Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9021b58e86235f305d4e18ace1771309cf43afbf2ed2e68f14982fbe11257747","observation_id":"6868191b-257a-47b9-9050-a49334d09a96","resolution":{"observed_at":"2026-05-12T06:01:24.331700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2605.18984","last_updated":"2026-05-18T18:04:54Z","snapshot_observed_at":"2026-08-14T06:42:41.818873Z","submitted_at":"2026-05-18T18:04:54Z","title":"Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T10:26:30.661042Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2605.18984"},"observation_digest":"sha256:062986c91ad678edeff04176676c2d1cc5490a3cef8aba289a16d5ad8518f186","observation_id":"b80cfbf5-0edc-4e68-925f-24735fec3fbd","resolution":{"observed_at":"2026-05-20T10:28:11.975833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-18T11:55:51.678572Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:bffcb0983f54065b4389a635ac6b1468af940a63de070a207e2488f14ce17818","observation_id":"79bdc297-7bde-4070-af2b-c81a42a28719","resolution":{"observed_at":"2026-05-22T06:36:10.480475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:b4c31548ac72165ba012e42f07b641d63678af2dc92d4052978aa8b0fb4e0a12","observation_id":"b7625811-fe53-4eb1-88e4-c186deff03ab","resolution":{"observed_at":"2026-06-29T23:04:01.935715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2606.03089","last_updated":"2026-08-13T08:19:05Z","snapshot_observed_at":"2026-08-16T23:09:40.763385Z","submitted_at":"2026-06-02T03:17:56Z","title":"Constitutional On-Policy Safe Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T11:47:14.135793Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2606.03089"},"observation_digest":"sha256:eb680699c52289c5044c2cdbfef0ae205f0b2cd29a54cbe68dd89254b7f86bcc","observation_id":"dddedaac-32b3-492e-8e54-1c748ab6b628","resolution":{"observed_at":"2026-07-02T01:36:25.457078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2606.08525","last_updated":"2026-06-07T09:05:49Z","snapshot_observed_at":"2026-08-14T16:18:16.719359Z","submitted_at":"2026-06-07T09:05:49Z","title":"DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T18:58:26.701929Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2606.08525"},"observation_digest":"sha256:8e503df1eaf333224300947111cbcef7d16c3dc3f5f4691b949cdca0c9b25366","observation_id":"d6d659d7-c35c-4a1d-bed0-a7be6463fb99","resolution":{"observed_at":"2026-07-02T22:27:25.547848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:264c77fee270cbf8e5f1b960d2462649fc7b33413a0e8626055da634d12de294","observation_id":"9fe2c2b3-6b3b-40da-ae05-615b3fd39c35","resolution":{"observed_at":"2026-07-03T04:27:37.083717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-18T09:28:19.221363Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:a2fa0d32ab1873bc533995377eac026acddf8bc100895604ee741cf08d3146e5","observation_id":"af9dee90-b69b-43f7-91f5-af013c095807","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-02T04:15:39.381986Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13712","last_updated":"2026-07-15T11:28:27Z","snapshot_observed_at":"2026-08-07T12:44:12.629063Z","submitted_at":"2026-07-15T11:28:27Z","title":"Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T04:15:39.381986Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2607.13712"},"observation_digest":"sha256:f755591ff4c7456e1094565453af506eb2b5767d86b36e80e68570b2b25ad4ae","observation_id":"63b262a9-8058-415e-821c-e6de659462c8","resolution":{"observed_at":"2026-08-02T04:15:39.381986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-06T00:20:22.395848Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-20T03:56:44.660192Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.395848Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:22c6a9ce95c9e60fa2d35310673967dd788d48121195e92d275e3815fcd4937e","observation_id":"2bc85b1a-3960-4f20-bac0-ddfd98d4493f","resolution":{"observed_at":"2026-08-06T00:20:22.395848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-15T14:24:49.741420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-19T06:38:37.104015Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.741420Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b4f992bf978a33261c9ae7a08fa7a7ea1c9fa3acff9f35afafd96894547cbbfd","observation_id":"c10d224c-4731-4766-8304-f2d4adcf8da4","resolution":{"observed_at":"2026-08-15T14:24:49.741420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10391/citation-record","integrity":"/paper/2502.10391/integrity","json":"/paper/2502.10391/citation-record.json","paper":"/paper/2502.10391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T18:23:49.523362Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.523362Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:9b53e7e43f778c97c58faf4b73dc5b46cebe6101bac793554e04e1d223f8e3e1","observation_id":"8f1b187c-2e91-4e11-8100-8651fc77a71f","resolution":{"observed_at":"2026-08-07T18:23:49.523362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T18:23:49.531232Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.531232Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:290e8d6a3e28a3de1d053cbf7f35457eabc1f1c0adf9870e3a55a7cc144b8b3a","observation_id":"d2981123-6329-48b3-a413-4224712e0d6b","resolution":{"observed_at":"2026-08-07T18:23:49.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-08-16T14:18:02.753710Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T18:23:49.539127Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.539127Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:87029cc4e35583bd72fed87176e577805f74db1f022f8270bdcfe72c4a7f109f","observation_id":"4f9838e1-e980-48ff-95a1-a0e08ad56315","resolution":{"observed_at":"2026-08-07T18:23:49.539127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.546058Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.546058Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:61c98abbd217997d1d673830108171f7774d4028a0a6a5cfd323c5bd829ee77a","observation_id":"499c3639-92f4-4e37-a1e9-9ec70e78aeee","resolution":{"observed_at":"2026-08-07T18:23:49.546058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T18:23:49.552483Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.552483Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a668f51b2d1d6281821924c3f5156cfe202a91af00c43ee8f533db91227d74a2","observation_id":"ef901459-183a-457e-afde-9f2ece4289a4","resolution":{"observed_at":"2026-08-07T18:23:49.552483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16890","last_updated":"2023-09-04T15:06:15Z","snapshot_observed_at":"2026-08-19T02:52:50.108039Z","submitted_at":"2023-08-31T17:52:04Z","title":"TouchStone: Evaluating Vision-Language Models by Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16890","snapshot_observed_at":"2026-08-07T18:23:49.558553Z","title":"Touchstone: Evaluating vision-language models by language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.558553Z"},"links":{"cited_paper":"/paper/2308.16890","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a662400320b8135538551211a6d00bcdb1a921b179aebf2961975f231bb466f8","observation_id":"2dcc7400-3811-4bfa-9905-b9f83fd47c1f","resolution":{"observed_at":"2026-08-07T18:23:49.558553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06595","last_updated":"2023-12-26T15:57:47Z","snapshot_observed_at":"2026-08-18T16:51:00.679875Z","submitted_at":"2023-08-12T15:27:51Z","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06595","snapshot_observed_at":"2026-08-07T18:23:49.564656Z","title":"Visit-bench: A benchmark for vision-language instruction following inspired by real-world use","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.564656Z"},"links":{"cited_paper":"/paper/2308.06595","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:eb7a1c931895fc827acc3460ffdc1b9081d3a307d81b3e78dba6cfd2987314c0","observation_id":"b6300708-95dd-4364-98a6-de3baf853e30","resolution":{"observed_at":"2026-08-07T18:23:49.564656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.622783Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.622783Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:403685e81b9dbad8c0786e26f1bf68f4b6bd0a0c778cdc356d73890aafdcaa23","observation_id":"a837664d-9ae9-4e18-8bcf-5152b23862da","resolution":{"observed_at":"2026-08-07T18:23:49.622783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T18:23:49.637480Z","title":"Are we on the right way for evaluating large vision- language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.637480Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:1cb655a04962d21ac992349298ddd740587309fb3e11ba216403263d6f9a1724","observation_id":"d1236c06-b979-4832-ba05-170e0a96013e","resolution":{"observed_at":"2026-08-07T18:23:49.637480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T18:23:49.679159Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.679159Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:26e91773e01b3c12055a84afa0c68d1ad73a9ec0cf3d536f775a79df70666c8f","observation_id":"8f907f7d-2050-48be-abc9-27c2a2d25941","resolution":{"observed_at":"2026-08-07T18:23:49.679159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09465","last_updated":"2021-11-08T08:31:44Z","snapshot_observed_at":"2026-08-16T18:50:31.552736Z","submitted_at":"2021-01-23T09:43:44Z","title":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09465","snapshot_observed_at":"2026-08-07T18:23:49.712859Z","title":"Websrc: A dataset for web-based structural reading comprehension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.712859Z"},"links":{"cited_paper":"/paper/2101.09465","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:68b188da2dfef896f01fdf9dee73b9acff7b9a74b4b52ed35cc8759c110dc630","observation_id":"ff0a1798-c851-430b-a8bf-b6b3fc6034c5","resolution":{"observed_at":"2026-08-07T18:23:49.712859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T18:23:49.745194Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.745194Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:e6e9c5e0a71c4358008586f238200f42a91084edd035a50d906c72b42b5f1e6e","observation_id":"1f52f174-8dd9-40e8-a87d-96932e6cb91d","resolution":{"observed_at":"2026-08-07T18:23:49.745194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T18:23:49.779403Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.779403Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:b433c78015ce71aca09286dd5cb2724b059372c44063831acf1cc2f49b966fe8","observation_id":"e1dcd352-3243-4d99-8347-784d4cd096b5","resolution":{"observed_at":"2026-08-07T18:23:49.779403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.787756Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.787756Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:ad511ed7b4987adac47a67e783922c94474fef0f1efdad0d09da27440c1fcff1","observation_id":"e14d5402-2079-4dc0-97bb-ceb0a69e7e40","resolution":{"observed_at":"2026-08-07T18:23:49.787756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-16T15:35:06.002888Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-07T18:23:49.795434Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.795434Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a368f878b95d2280f933860d83d1410fca53b939144a4bbd41a8f8aa6276ebb8","observation_id":"6e9ef6e6-ad4d-4ddd-ac35-445bbf735d62","resolution":{"observed_at":"2026-08-07T18:23:49.795434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-19T13:25:25.058603Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-07T18:23:49.802749Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.802749Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:9a714ea88d1e4408f968dc3f10a9e3a6cf58187527faf7222e1f658cf1644580","observation_id":"c0ad6dc9-7477-4748-a754-7959c63eb6e4","resolution":{"observed_at":"2026-08-07T18:23:49.802749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T18:23:49.810907Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.810907Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:16daabbf7c1ada6c5953ca09985b21f8bc178f8724918bce2d35a79768f2db7e","observation_id":"bf019ee6-6568-4fcc-b033-6447fa3d5023","resolution":{"observed_at":"2026-08-07T18:23:49.810907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.816591Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.816591Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:c4a78f2a9d5d243cc110c4d3f3f12cb06023ff564f290f4d9c133120c4f2ef20","observation_id":"ace44fbc-4616-4b1d-8ea0-67038fb73abd","resolution":{"observed_at":"2026-08-07T18:23:49.816591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T18:23:49.823966Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.823966Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:306d77778d28c87c7639f617cccedae0e071042350e88702bf472ce7fe615ec0","observation_id":"181ac02a-f004-420c-9145-ee9aa73774f4","resolution":{"observed_at":"2026-08-07T18:23:49.823966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T18:23:49.829925Z","title":"Video-mme: The first-ever comprehen- sive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.829925Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:95742aa2ce3589ef43af48bbbfe113a81453f2e9abc6cf7d3a747f3111f2826e","observation_id":"63fabce5-e990-4e70-aed4-1c56716c81ea","resolution":{"observed_at":"2026-08-07T18:23:49.829925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-16T13:27:24.086813Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T18:23:49.836288Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.836288Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:73531a4b5c62117024ee2de176ab695b3a42170a4537f5b580af8bd60cfb0f51","observation_id":"2eaab4af-c665-4c62-9349-65ff4b72a787","resolution":{"observed_at":"2026-08-07T18:23:49.836288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-20T07:59:47.616406Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T18:23:49.843627Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.843627Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:bfc349deb8f85b04f4aecc9282d5faed1a7bdc4f1f94eb7d46addd8e625eefb5","observation_id":"c292084b-02c9-477f-b785-df96ca3191a2","resolution":{"observed_at":"2026-08-07T18:23:49.843627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-18T21:58:09.907460Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T18:23:49.849204Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.849204Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:068cc9d5ab0c76f118f2ce50d051fa0afc9eaebbec39dfaa7570936d02aa6167","observation_id":"e71ccea0-7fe7-42a3-88eb-843910d7a257","resolution":{"observed_at":"2026-08-07T18:23:49.849204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T18:23:49.886875Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.886875Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:83f5e05f990911010f94d43296c590999abe36a9671f5294a1022c0c5bf7a4f6","observation_id":"7d442750-fa52-491e-a38f-d1a8e0582475","resolution":{"observed_at":"2026-08-07T18:23:49.886875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.893155Z","title":"Infimm- eval: Complex open-ended reasoning evaluation for multi-modal large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.893155Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:159affc22a97b0f854315d0d49490b031fcee11b40d35c371b1baf69861211b7","observation_id":"6896c9b0-4cf1-422d-bf1f-0956f20e2c7d","resolution":{"observed_at":"2026-08-07T18:23:49.893155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T18:23:49.899164Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.899164Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a94fab7b6ca45c8a8454c8304309b1f8a4b0a7dcea27e662a38b8bc16f207ee9","observation_id":"660fabdc-fa88-4af2-8055-43e8eb1228fb","resolution":{"observed_at":"2026-08-07T18:23:49.899164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-17T19:34:58.995686Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19939","snapshot_observed_at":"2026-08-07T18:23:49.905004Z","title":"Vlsbench: Unveiling visual leakage in multimodal safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.905004Z"},"links":{"cited_paper":"/paper/2411.19939","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:279f8be265c0aecca32313ce001e5c005ff00d4b9ed3c57eaf7d387989caa045","observation_id":"5cc59590-50e3-48f3-ad73-bba894f76022","resolution":{"observed_at":"2026-08-07T18:23:49.905004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T18:23:49.910667Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.910667Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a8d7d214d9fce4fe40c2cb88cf8d185a9189f8930c842ae718fce10910f67fdb","observation_id":"15a70143-3fe8-4ccc-b980-27fc3a716ce4","resolution":{"observed_at":"2026-08-07T18:23:49.910667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.916456Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.916456Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:0f7d7865c5f1544cd1405403fa4b065bcc35c6ba6f2058df406ccf2c6c27d5e0","observation_id":"52047ede-8d17-4efc-b77e-38bb3fb5d9be","resolution":{"observed_at":"2026-08-07T18:23:49.916456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:49.921302Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.921302Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:54b0f51d839f59e545835e09f18c6de3cccbdc0bb636999c9ffbe8733a802094","observation_id":"b855676b-334a-40de-9c4b-032a8a83edf5","resolution":{"observed_at":"2026-08-07T18:23:49.921302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-07T18:23:49.926724Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.926724Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:badd0c7cb7a13124b402a283592b6ae4e6e4090861012e5813112fe38c7ed946","observation_id":"93133f22-5bd8-43e2-8e97-4dbdc2bae508","resolution":{"observed_at":"2026-08-07T18:23:49.926724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T18:23:49.932313Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.932313Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:93c1833c1c1f4eb9c23bde08b64c0c16d1e8427a06f99b25ff678130cad9fa66","observation_id":"664a80c7-ddfa-489f-a597-752f7529b8da","resolution":{"observed_at":"2026-08-07T18:23:49.932313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-21T11:18:37.382248Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T18:23:49.937654Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.937654Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:f3bd6118087bd2be5dcd5889e40954feed7ab3a6e95a4e01576f162b6593dc0b","observation_id":"611c7e4c-0ec4-4ffb-99de-ecdc32dfe686","resolution":{"observed_at":"2026-08-07T18:23:49.937654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-18T12:01:55.297792Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-07T18:23:49.960160Z","title":"Seed-bench-2: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.960160Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:5978dd28a02309a0c87376130f706d4c7c28d4fdd907be74ac6828938344f788","observation_id":"29c7f356-9e0a-4313-a05a-78815ee61366","resolution":{"observed_at":"2026-08-07T18:23:49.960160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T18:23:49.989643Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.989643Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:d990e84d4f02566ac5ac5313e2fbe0ee41354074588bb04cc549ff738cfe1d93","observation_id":"d7dd9c67-2de6-4825-8f10-5c3a29621257","resolution":{"observed_at":"2026-08-07T18:23:49.989643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-08-17T03:27:30.826224Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-07T18:23:50.023089Z","title":"Vlrewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.023089Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:809609491fb9f7dd6f89826ebbaa750f11192c4842e4b2ae0ebf00c5dccf5880","observation_id":"07bc4a16-2f98-491a-9d28-29b500f400ec","resolution":{"observed_at":"2026-08-07T18:23:50.023089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-16T14:34:02.863082Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T18:23:50.053172Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.053172Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:62d7a47e06b6f6798408d27db79993beefd01e2b42df70d1136f9d84d7a83551","observation_id":"1a02d2a3-5dbb-4a20-85be-16e009ade606","resolution":{"observed_at":"2026-08-07T18:23:50.053172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12915","last_updated":"2024-01-23T17:07:18Z","snapshot_observed_at":"2026-08-19T14:31:11.453615Z","submitted_at":"2024-01-23T17:07:18Z","title":"Red Teaming Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12915","snapshot_observed_at":"2026-08-07T18:23:50.078954Z","title":"Red teaming visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.078954Z"},"links":{"cited_paper":"/paper/2401.12915","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:49a772c4ce16fa90e4d3fc2eed8f5c9d09d7ae11cde55c10570a39da6f05e529","observation_id":"6c7b39fa-091e-4f51-8c1b-4c81bdd9c969","resolution":{"observed_at":"2026-08-07T18:23:50.078954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T18:23:50.105233Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.105233Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:cbf778c365a87716a2416a3a05c39bb40a3b80861ccd7e22f189c7e615b1ec45","observation_id":"cc259b27-001f-40d1-a94d-c7a538e22db5","resolution":{"observed_at":"2026-08-07T18:23:50.105233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.113534Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.113534Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:46222db3a3be7bde10c2d6323ba530c0c1c10e8c2052632d69a2fb0b61a6ff14","observation_id":"307625ca-1c5d-45e0-99b1-1cbb7602ab7b","resolution":{"observed_at":"2026-08-07T18:23:50.113534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T18:23:50.119255Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.119255Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:b6cb44e764b250dacd56c5798d59caf0eb25327f8acf20016fbf32fc54fd9026","observation_id":"34a3a2f1-82cb-4415-b4fa-9ea99c0f61e3","resolution":{"observed_at":"2026-08-07T18:23:50.119255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.126001Z","title":"Mitigat- ing hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.126001Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:e09b522fcd6df8e80eb7fa510c375daac4b2425dc81fae21934cce5dd625e303","observation_id":"f0cc6a6c-1c85-4340-914d-9337bc03a544","resolution":{"observed_at":"2026-08-07T18:23:50.126001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T18:23:50.131674Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.131674Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:843fe1978efb6efad86fe846c9301d54bc7867a19722c71c62136408b4b9e2f5","observation_id":"54005270-c6d4-4418-a075-56be5888183f","resolution":{"observed_at":"2026-08-07T18:23:50.131674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T18:23:50.140384Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.140384Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:f745a8f97df16d823e8a74b06a38ab9f1ebbeff59908014a890c786739d6a8f4","observation_id":"0b0b0de4-b3d3-47d1-83ea-afb183c1f36d","resolution":{"observed_at":"2026-08-07T18:23:50.140384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.147293Z","title":"On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.147293Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:e5c41b46891084a98211140008b26f36f071896ffcfe20aaf27366cad4ae45ed","observation_id":"3ba341f0-f496-4fb8-84c4-f4b44c4e0116","resolution":{"observed_at":"2026-08-07T18:23:50.147293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.158193Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.158193Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:14c0ea1f3ffb4bb29e3555e36bee4d6bbdf8871f7a028250b62ac9e5a1fd48d4","observation_id":"bd0373a9-ea0e-4aed-9ced-1b4573ec00b5","resolution":{"observed_at":"2026-08-07T18:23:50.158193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T18:23:50.166266Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.166266Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:e0019f7b763f15c9f5ea04dccab5b293c752c7a8bf3d554bef4d7915fdc86508","observation_id":"9d58c1f4-8351-449d-adba-5a00f15124bd","resolution":{"observed_at":"2026-08-07T18:23:50.166266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.175244Z","title":"Mathvista: Evaluating mathemati- cal reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.175244Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:2b93e9dad4eb1ef5293c94ef42dcf47068d12287a77436796f62b57717d1f5fe","observation_id":"497f175d-391a-4e59-ba2e-3abc07d35f41","resolution":{"observed_at":"2026-08-07T18:23:50.175244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-19T12:21:16.378825Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-07T18:23:50.181923Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.181923Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:3c0c54b6417c10ccfdb2b3841538951a73acb6cc973dea5e2737c66382499c47","observation_id":"806c8e65-cc4a-4347-88c4-7850e57ad0dd","resolution":{"observed_at":"2026-08-07T18:23:50.181923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.187690Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.187690Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:faea54047dfd108fb937b2f62be28ad23f54a48cdff08b018b147d764eda347d","observation_id":"29f4eb57-c8e3-4128-94fd-c083cc3d04f7","resolution":{"observed_at":"2026-08-07T18:23:50.187690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T18:23:50.200612Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.200612Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:df1b43c8763b3b31fdff2a6d9640b76d6407bbe4111b41fdb765e76ee6fac4fd","observation_id":"a5f2564d-012d-42b1-a222-5a08b7d1521d","resolution":{"observed_at":"2026-08-07T18:23:50.200612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.206580Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.206580Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:552beab3aa79d1eeff277b5d85ae09b3c19c1d59274b89af4972d416f9dae09a","observation_id":"2f099e37-bcc5-4b03-8d86-1c85b9f0d297","resolution":{"observed_at":"2026-08-07T18:23:50.206580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.216767Z","title":"Docvqa: A dataset for vqa on docu- ment images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.216767Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:771a9d4fc71cedd27818c8081a0fafd391aa77da4255169e8ec1131a4e60da77","observation_id":"50556b81-2ef0-404c-b359-2507d4d9174b","resolution":{"observed_at":"2026-08-07T18:23:50.216767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.221793Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.221793Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:0c8e38a76b96890a879a6408291dc3df36f75c4071102c55f1701c4bed8d917f","observation_id":"43faba2b-9de1-401d-b4cb-5a5d719163de","resolution":{"observed_at":"2026-08-07T18:23:50.221793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.230249Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.230249Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:952624eec4e77c0ba77a2ffec31f7094a9db12833377b1a8e3ff506619ffb65c","observation_id":"a812eeb3-55c8-487c-ae51-de08261b7ab3","resolution":{"observed_at":"2026-08-07T18:23:50.230249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T18:23:50.247240Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.247240Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:ad7f8c421a1b493172541cf13a50a66f941008b65aae2dee727b3edd15d82a2f","observation_id":"e956c9ac-fcff-4fb9-8157-1a9e98f75bfa","resolution":{"observed_at":"2026-08-07T18:23:50.247240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.254953Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.254953Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:1bae57ef070f455e13f33f3890c1383d0896793b383ad89777169216e085696f","observation_id":"2472ce56-6b13-4997-9b04-5c126aa820c4","resolution":{"observed_at":"2026-08-07T18:23:50.254953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T18:23:50.291605Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.291605Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:5655747e6137f63407c2d9c33c7165b8f5a972d03c865cc3bca4e98a5e82cf84","observation_id":"c3bb5cc7-1fc9-49da-ad03-d63dc6f87a74","resolution":{"observed_at":"2026-08-07T18:23:50.291605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T18:23:50.322062Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.322062Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:b5a2a1a7d580cd03634d09e91eeb00bfe6ac4e458c186113eb60d24da58511f4","observation_id":"1fe8f71c-2019-44d6-80fb-a2c6a047ee68","resolution":{"observed_at":"2026-08-07T18:23:50.322062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T18:23:50.351029Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.351029Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:593fc9a71d8eb4525ec1a35c791dae88335aa01542a202e9ef1a774c01f407c5","observation_id":"743f2a8a-ae08-463b-8d0f-8a9b113cfb1d","resolution":{"observed_at":"2026-08-07T18:23:50.351029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T18:23:50.380394Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.380394Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:a62b705eccb9be3b5fac9f4b2f427a9e40b7dd6335e34f9eb80eb723658e6b72","observation_id":"e2ead512-85c7-4613-9168-fcf320b02b7f","resolution":{"observed_at":"2026-08-07T18:23:50.380394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08639","last_updated":"2024-10-13T08:53:00Z","snapshot_observed_at":"2026-08-16T13:35:01.263462Z","submitted_at":"2024-07-11T16:21:18Z","title":"$\\beta$-DPO: Direct Preference Optimization with Dynamic $\\beta$","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08639","snapshot_observed_at":"2026-08-07T18:23:50.415535Z","title":"beta-dpo: Direct preference optimization with dynamic beta","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.415535Z"},"links":{"cited_paper":"/paper/2407.08639","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:1c0f7457bf6054794951157cdfdd80d61ca9c17b5f7e8484454125d6ab09273a","observation_id":"e8882991-f408-49fa-a646-9d5517477e26","resolution":{"observed_at":"2026-08-07T18:23:50.415535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.428020Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.428020Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:170d1002a6a1572ca92acc476f8db49b2a4e82d287d44f09314b185fcc59da3d","observation_id":"650289be-35c1-41fc-b3ce-57969e223ca4","resolution":{"observed_at":"2026-08-07T18:23:50.428020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-20T15:12:29.214340Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T18:23:50.433458Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.433458Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:4c3fe24a5c333f66e8d68c6d2c871b7c8945f0b97844ddc738dcf6abc16bc17b","observation_id":"3c26313c-026e-4330-aa1a-b358d00c869b","resolution":{"observed_at":"2026-08-07T18:23:50.433458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T18:23:50.439693Z","title":"Errorradar: Benchmarking complex mathematical reason- ing of multimodal large language models via error detection.arXiv preprint arXiv:2410.04509, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.439693Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:bfe2a2ee5873707f2a95e75c82f2cb38208ceb5ca15014539670136ff1fe0709","observation_id":"54fc93e1-c672-4bc6-bd01-f06f3c2cd15f","resolution":{"observed_at":"2026-08-07T18:23:50.439693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T18:23:50.446156Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.446156Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:4be0a851f5f64e59b32dda6517df254e721fc0cb6d61158812b021ea74d71af8","observation_id":"867af584-15e8-4bc6-9321-a6d55ec46471","resolution":{"observed_at":"2026-08-07T18:23:50.446156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.452017Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.452017Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:8f4aa5de45cf2655ed6421db86d377b606151f30797c1cffe6cd78abb6950dc0","observation_id":"013cdb5e-9deb-4336-bb59-f5fe0855a149","resolution":{"observed_at":"2026-08-07T18:23:50.452017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.459008Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.459008Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:74f7094d363ece09c3da63c8aa6468eaccb54ea9dc73f4a8ec9b0cacdb8cec48","observation_id":"c0652f30-b4bd-4230-acb9-e8430b4f3d87","resolution":{"observed_at":"2026-08-07T18:23:50.459008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.467364Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.467364Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:03efaf2c62b84a8485e71376ac6967c787f36174e38995a64d6b024af692d7fd","observation_id":"a02aa576-5f30-4343-a073-97a557b4733c","resolution":{"observed_at":"2026-08-07T18:23:50.467364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:50.473897Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabil- ities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.473897Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:cbebf5a4657ac8330dc44e5f41c935ca0aefe7e44eac4b1b13025d091050acbb","observation_id":"e25afa4c-d9d2-4085-aeb8-7986d680207b","resolution":{"observed_at":"2026-08-07T18:23:50.473897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-13T05:48:57.895519Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-07T18:23:50.481768Z","title":"Self-generated critiques boost reward modeling for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.481768Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:2b3989821f33d9f01b6cf56467d48ef1e5ee3b10dfac37e2aa4640170b23ae67","observation_id":"d4229abe-225d-4a77-996c-286beb3372a5","resolution":{"observed_at":"2026-08-07T18:23:50.481768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-08-20T22:20:11.069630Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T18:23:50.488488Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.488488Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:93773f3a79b1df5f5d9d94efe423124b681597e8e6ba6f566234aaf0ab6d0b6e","observation_id":"818779c1-2700-4ed9-b07f-b56ceb686f4b","resolution":{"observed_at":"2026-08-07T18:23:50.488488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:53.052547Z","title":"Anyattack: Self-supervised generation of targeted adversarial attacks for vision-language models","venue":null,"work_id":"f015855f-27ba-42dc-ad2c-8ff29d2dbb7a","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.494838Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:3b98958200453aae8c004a516c734d00b36c5fedcc2b9cf5c16f807f5e568586","observation_id":"35e5ba8f-43a4-44c6-8c8c-ad4b8ed4eb98","resolution":{"observed_at":"2026-08-07T18:23:53.060100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-21T19:15:22.406940Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T18:23:50.500362Z","title":"Internlm-xcomposer: A vision-language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.500362Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:9b72c993824b320a0645aa0ffa6923e2398901975982403bdb53e1dbc04eea8c","observation_id":"b973462c-04d2-4ef6-9c00-0bdbeb016073","resolution":{"observed_at":"2026-08-07T18:23:50.500362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T18:23:50.508069Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.508069Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:b2d8e9bfe85c71ab38d79c32711507d792fadc8a9db6cdddbed1e63d4a1c1347","observation_id":"ad2f3176-c300-4042-a77f-2367a292f710","resolution":{"observed_at":"2026-08-07T18:23:50.508069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T18:23:50.516471Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.516471Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:f1ec3b92689973dda2eb80c14729df2a41843756dfaf943f96e05bd3960d7d83","observation_id":"f8a1bd3f-8f1a-4e44-ac29-90882517e885","resolution":{"observed_at":"2026-08-07T18:23:50.516471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05262","last_updated":"2025-08-14T12:30:25Z","snapshot_observed_at":"2026-08-21T10:22:50.018017Z","submitted_at":"2024-03-08T12:35:07Z","title":"Debiasing Multimodal Large Language Models via Penalization of Language Priors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05262","snapshot_observed_at":"2026-08-07T18:23:50.524073Z","title":"Debiasing large visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.524073Z"},"links":{"cited_paper":"/paper/2403.05262","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:f91e3dafb0b062f5b5d39990150d75c670935ed5f2b92fee0191c96befe61dc5","observation_id":"da4ce379-8a1f-4957-b71b-6372f400c90f","resolution":{"observed_at":"2026-08-07T18:23:50.524073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-07T18:23:50.530539Z","title":"Mme-realworld: Could your multi- modal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.530539Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:4991d03367e68be96c5580b55a377c4c7bcac1a41ba8e5ef5a1fa4ef85e7338f","observation_id":"243109b7-9c10-4e28-9420-bcd07a671154","resolution":{"observed_at":"2026-08-07T18:23:50.530539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:53.033697Z","title":"Multitrust: A comprehensive benchmark towards trustworthy multimodal large language models","venue":null,"work_id":"6c08c128-72fb-4000-97bb-07af68f9cfbe","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.541250Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:723eeab1cac38e44ee01d915f706a9e2edc02c28d68217cc64c017e9c5e93964","observation_id":"45ddd3ac-d608-4fad-8f74-2418c6c694fe","resolution":{"observed_at":"2026-08-07T18:23:53.039442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T18:23:50.551232Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.551232Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:3ce3d7f4f1dd36caa7f16b9abed9258a4442c24b3d20b2e8fd432bc2cc350bc5","observation_id":"73da6a09-7f01-4c25-b393-89a6b3c6cfe2","resolution":{"observed_at":"2026-08-07T18:23:50.551232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-20T19:28:32.512392Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-07T18:23:50.561901Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.561901Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:9d5db9ab9e32cf4f4d1e0a264419693a8eff21019820e5959361d48417588b30","observation_id":"bf4c39da-e164-4a99-8e60-4ee06a4b2c4c","resolution":{"observed_at":"2026-08-07T18:23:50.561901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:53.010028Z","title":null,"venue":null,"work_id":"70aabcbe-031f-4068-a7da-e5f7d7c2850d","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.591600Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:cb07cefd53c38a2b8ad38b21b3b86bd9c0d3017e2067ca1729271b4d4f811d89","observation_id":"7cddd6f3-8f5a-40a4-b218-d727338672f6","resolution":{"observed_at":"2026-08-07T18:23:53.018387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.989988Z","title":"Minimize errors and misleading information in object relationship descriptions","venue":null,"work_id":"6ea797cc-a4e4-49f8-b14b-4313a90a4f9c","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.614571Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:cc8d35a4075994bac82e53c32543f6988791792968cf9e6f6e89128473b298d6","observation_id":"df2f2f70-22d7-4e94-90ac-4e278ccfd0d3","resolution":{"observed_at":"2026-08-07T18:23:52.996592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.965956Z","title":null,"venue":null,"work_id":"eca32198-a33a-4a4a-80d8-08d3f804997e","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.637416Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:e03f135d90db62eb9de16c5a71c1902cc31b5b34bb572a0e81ad1e5dec215787","observation_id":"0af65dce-5e38-4900-9fac-e1c181639057","resolution":{"observed_at":"2026-08-07T18:23:52.973227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.945565Z","title":"Rating Scale: • Severely Inaccurate: Major errors in object descriptions, relationships, or attributes, or references to non-existent objects","venue":null,"work_id":"5504ad1e-2ef7-4e79-ae55-df02f8d16e97","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.658532Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:99903ca07ca643d298c70dc2ace0ec0ca2344acaf1fdcfc4fc4dd1ab366c937e","observation_id":"feaa45a4-8089-4844-9586-8c5f4934f993","resolution":{"observed_at":"2026-08-07T18:23:52.952674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.920601Z","title":null,"venue":null,"work_id":"c35ede50-66ac-4b0c-ae9e-ed5cdc8847bd","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.668279Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:6855ec5ab630cfd7ae765aedaf26d0bccf86b75fc3cfeb1a2450be1d72d561d1","observation_id":"e9b2b42c-bec4-4786-b0d2-8fd8d079d772","resolution":{"observed_at":"2026-08-07T18:23:52.930281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.899776Z","title":null,"venue":null,"work_id":"b0f6e2b0-438b-4855-8775-19acc89aa0e3","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.674125Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:749e62cc53a6f8e8061d067444ce5313280e28b75cf725539687a2c3a76a11a4","observation_id":"bba01542-4ba8-4b6f-b818-9f141c17f1cd","resolution":{"observed_at":"2026-08-07T18:23:52.905978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.874000Z","title":"Rating Scale: • Not Helpful: The response does not address the user’s prompt, providing entirely irrelevant information","venue":null,"work_id":"a4248dfe-e5f4-4774-b60d-d09711b96118","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.680665Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:c92e5a6aaa2209fcc7cd1a63fdff7156044b68316b112ba9095d78e7fea90a4f","observation_id":"641145cc-ad23-4261-b4ce-2e26fd23b2dd","resolution":{"observed_at":"2026-08-07T18:23:52.881053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.853538Z","title":null,"venue":null,"work_id":"d53ada26-4935-48f2-a425-ab5c6876feb9","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.687335Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:bd0ae575f5f72f5d643a265c7111443521cb320a2b35e4316284d2e972cb8a25","observation_id":"4e6f05a8-7ba5-4de2-9c92-90db14272085","resolution":{"observed_at":"2026-08-07T18:23:52.859324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.832338Z","title":null,"venue":null,"work_id":"0af8596c-82a8-4b15-a1bb-9d709d5a2671","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.694405Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:8395ecb84a2eb34436148fe2cbc98a9a8b62b6aa564ffeb221689a2ab42ccb86","observation_id":"4472717b-5d78-4143-bba7-a6b160ade966","resolution":{"observed_at":"2026-08-07T18:23:52.837576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.810975Z","title":null,"venue":null,"work_id":"5036dd08-40a5-4325-b5a5-3cc6c077d830","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.699636Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:8e6bb0e73b2192a2cbfc83c9e0f5d6a30350fa1fc7e27ca578aa64bea5d47f37","observation_id":"8a14ad96-75a4-4276-b9cf-fcb3b8ce1eb1","resolution":{"observed_at":"2026-08-07T18:23:52.817360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.768725Z","title":"Rating Scale: • Highly Unsafe/Privacy Infringing/Unfair/Harmful: The response contains severely in- appropriate content that violates ethical standards","venue":null,"work_id":"1ed6d916-758f-43de-9685-3885e0a7fb48","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.708433Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:20cb5ab9b13c6a0e4e70aae9ca3ca7192117928f756038b64183deee21278758","observation_id":"3fa1a848-13a6-4ce2-9f24-e3cae8da8789","resolution":{"observed_at":"2026-08-07T18:23:52.795219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.624831Z","title":null,"venue":null,"work_id":"d82ecb41-1891-415a-a966-ff637c587f7f","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.716816Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:02f527af9b1b193bb30181d4f6589a06c2cac05688ea158806c8280a007256f5","observation_id":"5cd7bab8-0691-4bf4-8681-7493b6f3778d","resolution":{"observed_at":"2026-08-07T18:23:52.670958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.599735Z","title":null,"venue":null,"work_id":"9419182d-2c68-4923-8f6d-680bcbc4901e","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.725674Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:95603ea6899183f3c7a9e05961cd4cccfb64b2da95dc353c8367c012dacc01d0","observation_id":"c8387972-2eaf-41bc-9039-9a889791bda9","resolution":{"observed_at":"2026-08-07T18:23:52.605802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.577058Z","title":null,"venue":null,"work_id":"ae06635a-74d5-4123-945e-17a219097f5d","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.731660Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:340f2e133387105f3d5434e3ca02c99813b80bf3047850512eb0d23c17180e30","observation_id":"f7f1d375-68cd-4e58-9466-016ab5c1d92c","resolution":{"observed_at":"2026-08-07T18:23:52.582997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.547382Z","title":"If a tie occurs, provide a negative example (for multiple-choice, offer an incorrect answer; for long text, modify the content to include erroneous information)","venue":null,"work_id":"922b7659-5213-40ef-b5fc-f093f2462f6e","year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.738265Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:c956e82c7469980c3c3676e17d20c5b58a03aa4341230b3acb6121ba091a9116","observation_id":"345db11a-f047-4552-9a9a-186070e0c9d4","resolution":{"observed_at":"2026-08-07T18:23:52.559238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:52.516613Z","title":"Please describe this image,","venue":null,"work_id":"e50a5579-f1fc-43b0-89e3-2887d235288b","year":2010},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.744223Z"},"links":{"citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:f62cd58a8995ac5eea6118888c45c56b9fdc32f00d995d4f4d68326198870d37","observation_id":"ff238f26-110a-4a13-9526-d065d338e51a","resolution":{"observed_at":"2026-08-07T18:23:52.526170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T12:43:24.932114Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 27 inbound Pith citation observations for arXiv:2502.10391."}