{"as_of":"2026-08-08T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:278e730a9f86310acdf865f0ad25c4ebcefca3ed834eaef8ce150d9471da5606","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:34:56.530687Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:46:36.081851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:30.415184Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:aee2f4a7b858d7ff3bceb7b3aad88b8d27107240df0da00d7202621f7fc06222","observation_id":"728a9f85-9465-4cee-b8ae-81837063aed8","resolution":{"observed_at":"2026-05-23T01:32:22.432616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:1b1d1dd0b9e72d53c1e5228ae66b2ec2b2e59a8de5df27ceaf8dea96450d30f0","observation_id":"82156c10-6644-4c2e-9a4a-327d31728a7b","resolution":{"observed_at":"2026-05-10T14:00:28.711508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:dec1b8eb10a25bd29a265ae6481879c89b7369945a59f4718dc91b7136f932f3","observation_id":"5da103f6-4edf-46d2-9d1c-883a3a2601ec","resolution":{"observed_at":"2026-05-11T13:26:04.075359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2606.05660","last_updated":"2026-06-04T03:43:09Z","snapshot_observed_at":"2026-08-03T21:53:08.948703Z","submitted_at":"2026-06-04T03:43:09Z","title":"Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation","version":1},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-06-28T01:46:36.081851Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2606.05660"},"observation_digest":"sha256:06e7c3fc9c5745479a25177ef494ed0d6c25b391ed389f457f4a75aaaa15a8a9","observation_id":"984b7b75-dd33-46db-9b93-a28a21cc54ed","resolution":{"observed_at":"2026-07-02T12:56:56.761079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-06T16:20:57.348779Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:199637ddd312710f39423c6014eafbee92fda68eda86064557035c60353a4c21","observation_id":"674ecc18-d9f2-4006-87c0-b9d1b71c5b2f","resolution":{"observed_at":"2026-07-02T17:37:14.732384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:aa69ba4571e58a624e36cf780f888b728356d649bf20c487148d4c74cb0050f3","observation_id":"d3cc7c17-880b-4070-bf1b-06e0208dc4e8","resolution":{"observed_at":"2026-07-03T01:37:30.416476Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18531/citation-record","integrity":"/paper/2505.18531/integrity","json":"/paper/2505.18531/citation-record.json","paper":"/paper/2505.18531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:59.231987Z","title":"Machine behaviour.Nature, 568(7753):477–486, 2019","venue":null,"work_id":"d54bf838-0336-441f-abed-c295c663c883","year":2019},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:51.781741Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:a857241eb11e3aafe1feeaeb12e832f99b23f435a87c1bbbb7e144ad7b38b97e","observation_id":"52a99462-90e1-4ab7-bd0c-14e5fe19f776","resolution":{"observed_at":"2026-08-07T14:34:59.349875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:58.917930Z","title":"Position: The platonic representation hypothesis","venue":null,"work_id":"78fe4d0e-9e13-4a2f-93a2-f4245f697693","year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:51.856669Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:0bcfb5a51182671d59a99f28b1ad3eacefb628f1e319780580d77dc5f0c4cd9f","observation_id":"1359e8a1-2d26-4219-a312-5d91c55f3c93","resolution":{"observed_at":"2026-08-07T14:34:59.063038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T14:34:51.982149Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:51.982149Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:f001493e1b508a8834887b6f950a4597187db6573b6c77ea890560aa7fc57337","observation_id":"e3134af0-548e-4fd7-baa0-593b445b2844","resolution":{"observed_at":"2026-08-07T14:34:51.982149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:34:52.093446Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.093446Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:225029b4937fffd6efc95705d317a4f4146c13b1c58a55d7843df27709029733","observation_id":"cd735611-0f77-43ff-9c69-1e1ee27c4c29","resolution":{"observed_at":"2026-08-07T14:34:52.093446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:34:52.213552Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.213552Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:af059416d9d91b4d3605244b5d474938b955526846e672989d2c6e7b970da114","observation_id":"623e31c2-459d-446f-ada9-acb8138d1d65","resolution":{"observed_at":"2026-08-07T14:34:52.213552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:34:52.342099Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.342099Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:30e462ed0ad7634321a2b25eedc07665c501958ba3b52dec0a08004623bb123a","observation_id":"f8f34cbe-3bb1-4204-aef1-f334d06d5fc7","resolution":{"observed_at":"2026-08-07T14:34:52.342099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T14:34:52.484882Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.484882Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:dea6d4db15841700bdbaec06cd34f168eb1050728638cd31b79176fd2099d50f","observation_id":"e6d81959-21c7-44ba-b9e0-e5d89af0b7ee","resolution":{"observed_at":"2026-08-07T14:34:52.484882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:34:52.613268Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.613268Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:bf56af5cf8029fc4785a99e400c2c00cfa496064573d61b977d49d5ce8e5fc66","observation_id":"d10f924b-abf7-43d2-bd37-e92e23c18266","resolution":{"observed_at":"2026-08-07T14:34:52.613268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T14:34:52.685004Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.685004Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:58852cc4fdfc86688ca5b4b29ed458a399e6d48d0cbd74bc5beb80eb8cc8a2d4","observation_id":"d727a3bb-bf2b-46f0-a4e8-897b4c468adc","resolution":{"observed_at":"2026-08-07T14:34:52.685004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:52.745966Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.745966Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:3608cdc99d139cbe6e9f2baabb4f1f6cbd0b0899a541ed6b9af9ca8497d2cb27","observation_id":"8ee10568-f094-4b98-9881-81503bf2fc48","resolution":{"observed_at":"2026-08-07T14:34:52.745966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:34:52.837437Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.837437Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:b5143837bd062f154d4850c7f22e541394efe1aaffd31cff846080c771f72f38","observation_id":"b6922c7f-d46c-4afa-8924-5804c5de8353","resolution":{"observed_at":"2026-08-07T14:34:52.837437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-07T14:34:52.908750Z","title":"Ai alignment: A comprehensive survey.arXiv preprint arXiv:2310.19852, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.908750Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:8e3ab6f67a9bbfd8bdfcbd12e3c5cbc9c9b2a93c0d84cb0e8f95529516082fb2","observation_id":"29e48177-1199-416e-96af-85929b9fff2f","resolution":{"observed_at":"2026-08-07T14:34:52.908750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T14:34:52.995877Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.995877Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:938d07afcca447ac5b65f787c5b77fe14b2889122969636cb5c0637f95402848","observation_id":"6d919e31-cbdf-4830-bb6e-b5f1ee4e564a","resolution":{"observed_at":"2026-08-07T14:34:52.995877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:53.070027Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.070027Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:ac54a753df541bec3c5501c41bb028c84cdd54214a1fbb4446e8842cd5067524","observation_id":"dfc96d4b-a586-44b6-89c8-d0f0201f66e8","resolution":{"observed_at":"2026-08-07T14:34:53.070027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07957","last_updated":"2025-04-27T07:20:02Z","snapshot_observed_at":"2026-08-07T16:06:45.226662Z","submitted_at":"2025-04-10T17:59:12Z","title":"MM-IFEngine: Towards Multimodal Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07957","snapshot_observed_at":"2026-08-07T14:34:53.141416Z","title":"Mm-ifengine: Towards multimodal instruction following.arXiv preprint arXiv:2504.07957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.141416Z"},"links":{"cited_paper":"/paper/2504.07957","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:f1bd85952d2e2f5d06fb8d4ba527a46fe0a01b13d8b041ffe0f82c9c209379dd","observation_id":"ce052be3-c027-4d9c-8e25-20d10f7eb5df","resolution":{"observed_at":"2026-08-07T14:34:53.141416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:34:53.195079Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.195079Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:2b03fadf504c1afdd931855c4d472f1ea784d9ac75db0fe962c997d13a8724ab","observation_id":"b88ba47c-6566-419d-8439-1d04142bb021","resolution":{"observed_at":"2026-08-07T14:34:53.195079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:58.623928Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"95bb1673-6cf6-48dc-bc80-a78c75ee1326","year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.248426Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:777136bfa4ce029c4e795b40cf6dd2e888534b0f5771e14717f30c57d55b14a8","observation_id":"935d3d34-b17a-4890-b3d3-d729b735bc58","resolution":{"observed_at":"2026-08-07T14:34:58.796943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:58.357726Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"c44752f1-4f25-4edf-b73e-03acccba12df","year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.310333Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:53756403dc2f44ffea0646d74e0bfdb934de15d183f9dd474c3c1cacf55926a7","observation_id":"9ab55e76-ce5c-49ec-99b3-912d3ec48425","resolution":{"observed_at":"2026-08-07T14:34:58.467639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:53.381691Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.381691Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:d14b0fe81a310a2c94d4fb2e8e7782c0fdab732d5085a15b61ed5ba9b6ca71c7","observation_id":"d1dc4680-32bd-420c-887c-cec55f5194ae","resolution":{"observed_at":"2026-08-07T14:34:53.381691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:53.463689Z","title":"Sequence to sequence reward modeling: Improving rlhf by language feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.463689Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:ca475d68b2e635a0524796f24b8277eb319daf60f14a9564ac7aee883aaf0231","observation_id":"a78ac211-9a6f-4e48-8125-5974f0f11af6","resolution":{"observed_at":"2026-08-07T14:34:53.463689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T14:34:53.519748Z","title":"Critique-out-loud reward models.arXiv preprint arXiv:2408.11791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.519748Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:71579743a4cacebf0f2ee8da21c29c292f1ea2da2dfa374e785ba52b0c996772","observation_id":"053d29f9-a696-4f8b-bf2c-3e99b8a48106","resolution":{"observed_at":"2026-08-07T14:34:53.519748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:58.045172Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"d5123d1c-32e3-4fa6-b078-ccfac2d489ba","year":null},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.612089Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:6aa402258093fa9658248b4264155e5fe0d02d4cfe99e7d480f43e9dc0f773ea","observation_id":"3e36d3c2-5495-4f18-8ed3-08938b55deb7","resolution":{"observed_at":"2026-08-07T14:34:58.190130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T14:34:53.738399Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.738399Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:39052ac549f5240144f83687c346677907d1ba3e2542db61551bd762025ca3e6","observation_id":"1763faa3-2891-4513-aeef-99914871d801","resolution":{"observed_at":"2026-08-07T14:34:53.738399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-07T14:34:53.833434Z","title":"Unified reward model for multimodal understanding and generation.arXiv preprint arXiv:2503.05236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.833434Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:734b52b6a2a82a2383437c5babf3b551a08e8c6eb294383c7d145f4f700de4f8","observation_id":"4fa3500f-5b2d-4877-8ebe-ebbdf249ef2b","resolution":{"observed_at":"2026-08-07T14:34:53.833434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T14:34:53.906318Z","title":"Llava-critic: Learning to evaluate multimodal models.arXiv preprint arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.906318Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:ce7a4862d06e0c25b0b8190f3c5d612cbd7d2433afd6e78f148ff3bb9c597a33","observation_id":"a30d78d2-7615-43c0-8935-7779e8671eeb","resolution":{"observed_at":"2026-08-07T14:34:53.906318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:54.000417Z","title":"Inference-time scaling for generalist reward modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.000417Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:8664787a5b60f4c790491cc1c614cd089f8cfc5e19fa421d0561b71ee2c94c41","observation_id":"80c05f73-3ac8-4538-ba17-7cd5668d1964","resolution":{"observed_at":"2026-08-07T14:34:54.000417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:54.081292Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.081292Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:619eb4c5d304015a4f75a6875b5e502ab48440ee3e9437d3291ca2699658424a","observation_id":"cef6e9f4-d236-4ce6-8e38-760a869cdd3b","resolution":{"observed_at":"2026-08-07T14:34:54.081292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02666","last_updated":"2025-08-29T15:47:44Z","snapshot_observed_at":"2026-08-07T15:56:21.317990Z","submitted_at":"2025-05-05T14:15:02Z","title":"A Survey on Progress in LLM Alignment from the Perspective of Reward Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02666","snapshot_observed_at":"2026-08-07T14:34:54.149826Z","title":"A survey on progress in llm alignment from the perspective of reward design.arXiv preprint arXiv:2505.02666, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.149826Z"},"links":{"cited_paper":"/paper/2505.02666","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:0e5d93a4adfe4eb3fb8ec4639bc8ab841a08c06dee208122e78828acb9654777","observation_id":"ee03b3fa-d2de-4e87-a295-f23b14920c33","resolution":{"observed_at":"2026-08-07T14:34:54.149826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03742","last_updated":"2024-10-13T10:21:29Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-01T07:38:58Z","title":"Beyond Scalar Reward Model: Learning Generative Judge from Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03742","snapshot_observed_at":"2026-08-07T14:34:54.230084Z","title":"Beyond scalar reward model: Learning generative judge from preference data.arXiv preprint arXiv:2410.03742, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.230084Z"},"links":{"cited_paper":"/paper/2410.03742","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:f87074948faeaa8547a1394ef6b2820633b468b8c8a81c5d359189de53248cbb","observation_id":"fe590e6b-b6e5-4f90-a71c-5e6eb9fd070e","resolution":{"observed_at":"2026-08-07T14:34:54.230084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:57.691391Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"2f4c869d-b6c0-44ea-8cad-4d96fe4caa9d","year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.304404Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:34c2657ae06db80f3f3b3b8800dd1fe898f8e4c6d067b6482a5cb0ab489d77b1","observation_id":"a4e55663-8b76-49a3-ad9d-a4f21805e668","resolution":{"observed_at":"2026-08-07T14:34:57.853980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:54.380007Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as- a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.380007Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:8a0a980dc99f97bc54374ed7f5f17c2ef4fb6339b6a973c7297c148ce01041d1","observation_id":"9d24378c-c3ff-4b89-ac05-ab2d8925661b","resolution":{"observed_at":"2026-08-07T14:34:54.380007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04950","last_updated":"2025-04-07T11:34:48Z","snapshot_observed_at":"2026-08-07T16:08:01.051306Z","submitted_at":"2025-04-07T11:34:48Z","title":"A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04950","snapshot_observed_at":"2026-08-07T14:34:54.497908Z","title":"A unified pairwise framework for rlhf: Bridging generative reward modeling and policy optimization.arXiv preprint arXiv:2504.04950, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.497908Z"},"links":{"cited_paper":"/paper/2504.04950","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:d19efd9200d721aa178bb6a6a6d99f5ff2454c46d6bb8bb06d909d82c2a00f40","observation_id":"79be537c-ece5-4495-b294-07b595d9fd67","resolution":{"observed_at":"2026-08-07T14:34:54.497908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:57.561095Z","title":"Pairwise proximal policy optimization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"117f2653-0c40-4e89-9319-b1dcd865f133","year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.578435Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:05a2b4155681a6606df54d9b7cab7ef0bd2fe512daad53572f30ac066e03775f","observation_id":"5d07aa45-5ab5-41ed-b037-578289eacc1e","resolution":{"observed_at":"2026-08-07T14:34:57.634491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:34:54.662351Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.662351Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:294dc1f382c7a772465d3a0817ca66501a5526bc75dfa51d26d842c22e135ce7","observation_id":"d1919462-3483-4a39-b78c-d3c2f717c9c6","resolution":{"observed_at":"2026-08-07T14:34:54.662351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T14:34:54.754538Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.754538Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:bb791a3fe8b3b4a9f5e3dc89e1ba2a5dc3d7c4169d8830c4f10b749a89033d0f","observation_id":"6cdd35f8-35e6-4c18-9d7c-3b05baadb601","resolution":{"observed_at":"2026-08-07T14:34:54.754538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:54.885470Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:54.885470Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:f87348b5e40134d07f03241c97a45f93818664eb4334243d55ce0ca25caf0997","observation_id":"7395b120-d87a-408a-94b0-37364b8e45e3","resolution":{"observed_at":"2026-08-07T14:34:54.885470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18702","last_updated":"2024-06-26T07:44:11Z","snapshot_observed_at":"2026-07-06T16:55:05.210009Z","submitted_at":"2023-11-30T16:52:42Z","title":"CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18702","snapshot_observed_at":"2026-08-07T14:34:55.013457Z","title":"Critiquellm: Towards an informative critique generation model for evaluation of large language model generation.arXiv preprint arXiv:2311.18702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.013457Z"},"links":{"cited_paper":"/paper/2311.18702","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:f0453c7b8117ff98f8b1ce732906c5113d6bd486f992c0cd30625f1ce329fb1b","observation_id":"cc82f5a6-d743-41f8-be7d-16ad5d48d062","resolution":{"observed_at":"2026-08-07T14:34:55.013457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T14:34:55.112648Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.112648Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:2a413b9b937b526b1a02aac161c2fe9315633a9236bc92e930f5e3aa60bd1b51","observation_id":"62de62e2-b0ec-4e6f-8e41-c84fe1f9368e","resolution":{"observed_at":"2026-08-07T14:34:55.112648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:55.184677Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.184677Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:eba095bae6c8d6b65cda045cccec7d8b23f634825326cce90737f7d8b64b0084","observation_id":"2e2966af-922c-4976-8a13-ebd3c350c01d","resolution":{"observed_at":"2026-08-07T14:34:55.184677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T14:34:55.253963Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.253963Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:d84640b8d7d23f627805b04470961edbffefd042503d29241a31cdab863515e0","observation_id":"ae56dbab-7a2e-43bd-8dcc-caf3f8bb724f","resolution":{"observed_at":"2026-08-07T14:34:55.253963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:34:55.364341Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.364341Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:bf7a28889d0d989eebf0c413b8c92ec8e7c4b3bd1987b060cc199c735b589cbe","observation_id":"1b496ee1-faab-472b-86ff-85473e424dda","resolution":{"observed_at":"2026-08-07T14:34:55.364341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:34:55.460092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.460092Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:7321ebf666a2e4cf4dad89be26f5d6f7fe2cdf96a96be5e52965de6139cfb817","observation_id":"3db04bc1-b713-4df1-a136-bbdcad8cefd3","resolution":{"observed_at":"2026-08-07T14:34:55.460092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-07-06T20:10:51.514813Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15838","snapshot_observed_at":"2026-08-07T14:34:55.554751Z","title":"Align anything: Training all-modality models to follow instructions with language feedback.arXiv preprint arXiv:2412.15838, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.554751Z"},"links":{"cited_paper":"/paper/2412.15838","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:ced91eef61b7bea36eb162c6e301113e2156d1ca8e1e15b8642b524291a5e328","observation_id":"e4fbbf22-fdf0-409d-b2e1-5dc8c0824026","resolution":{"observed_at":"2026-08-07T14:34:55.554751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17682","last_updated":"2025-05-22T15:42:20Z","snapshot_observed_at":"2026-08-07T16:44:27.053279Z","submitted_at":"2025-03-22T07:40:20Z","title":"Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17682","snapshot_observed_at":"2026-08-07T14:34:55.643156Z","title":"Safe rlhf-v: Safe reinforcement learning from human feedback in multimodal large language models.arXiv preprint arXiv:2503.17682, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.643156Z"},"links":{"cited_paper":"/paper/2503.17682","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:95ed8e1108fcbd51d0bcdfef9aa460713c218332c97b8cfc6846285cca7a635d","observation_id":"418727c9-566c-4acd-87f1-fd81820d4ac0","resolution":{"observed_at":"2026-08-07T14:34:55.643156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01509","last_updated":"2025-03-20T02:49:09Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:53:35Z","title":"MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01509","snapshot_observed_at":"2026-08-07T14:34:55.736257Z","title":"Mia-bench: Towards better instruction following evaluation of multimodal llms.arXiv preprint arXiv:2407.01509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.736257Z"},"links":{"cited_paper":"/paper/2407.01509","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:dd9b4b95050e256f1104e3ee9298bd51414a32f6f57495d4b1a21abb463108bd","observation_id":"b6ad1ebc-e9b2-4191-9db1-a3959039a924","resolution":{"observed_at":"2026-08-07T14:34:55.736257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:55.819660Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.819660Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:7cee051ac01c14eb9258074ec8da39d18fc96b4d6b8445d66f74019a0cafbed3","observation_id":"86cffb9d-9813-42bf-9d7e-1f387ca7258c","resolution":{"observed_at":"2026-08-07T14:34:55.819660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:55.904276Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:55.904276Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:3191ed20a2a9f64c9b13cb4a41ac8ea03cb97d450d6ba07cb4384d3f4b284fe0","observation_id":"9941a29e-9d71-4f62-9880-7454f21155b3","resolution":{"observed_at":"2026-08-07T14:34:55.904276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:57.403702Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"9dca6f3e-cfdf-44c3-847f-6356b3aa2a70","year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.006470Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:54aaa3eb2397424f5b29c9d4d77228c81ee7f9f14a318dd86223fc672400ff7c","observation_id":"b98aa5a5-b8eb-4955-b336-a41c1b9fd295","resolution":{"observed_at":"2026-08-07T14:34:57.467100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00765","last_updated":"2024-12-01T06:08:00Z","snapshot_observed_at":"2026-08-06T07:47:35.642444Z","submitted_at":"2024-08-01T17:59:54Z","title":"MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00765","snapshot_observed_at":"2026-08-07T14:34:56.100138Z","title":"Mm-vet v2: A challenging benchmark to evaluate large multimodal models for integrated capabilities.arXiv preprint arXiv:2408.00765, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.100138Z"},"links":{"cited_paper":"/paper/2408.00765","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:85ab291cc8400fd06adb6c812e0eab11e4a9bee3a618f5d3da8f2c867ffcfe4f","observation_id":"e2d2eab0-142b-433a-bce1-7e25feec12ab","resolution":{"observed_at":"2026-08-07T14:34:56.100138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:56.195672Z","title":"Mm-safetybench: A benchmark for safety evaluation of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.195672Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:665f5f9fc7fc4f2e171ef8e734e1a103b967f52880cb0005f70f9a5f22142049","observation_id":"ed1870d8-1ef6-4e2d-9138-067accb5dffb","resolution":{"observed_at":"2026-08-07T14:34:56.195672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-07T14:34:56.289308Z","title":"Multimodal situational safety.arXiv preprint arXiv:2410.06172, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.289308Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:72da52bfc87542079e1cfb67af7abb9fea109ae087dc79e8f459d4c2ed5119a9","observation_id":"136e2999-40e0-4b35-bac4-99a0026ac9fe","resolution":{"observed_at":"2026-08-07T14:34:56.289308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T14:34:56.359753Z","title":"Concrete problems in ai safety.arXiv preprint arXiv:1606.06565, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.359753Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:bbaf563e84a53e224e3f3734f92102c5446a7d8911d8c9acfc8ad3a58ee4fc6e","observation_id":"e700ad34-5f58-49d1-ae35-a126ddc9674c","resolution":{"observed_at":"2026-08-07T14:34:56.359753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:57.227174Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":"4138cb4c-fc3e-41e4-8a7c-d2535f7c34b9","year":null},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.459348Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:1359bfaf3543f837fa310aad76f45ec6ff59e5b1dd38b946d016d2152dba756b","observation_id":"5e4a659f-7d3a-43f7-a589-0ffff9a3f635","resolution":{"observed_at":"2026-08-07T14:34:57.320747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:57.048783Z","title":"image-text sequence understanding","venue":null,"work_id":"a6a27650-ac01-46b1-8a85-7de0d9a24cbd","year":2023},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:56.530687Z"},"links":{"citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:a940da590a628717fc34b8b7d16b8e41bc2e53b9ce7399d7f85ca444cf09e8fb","observation_id":"ec594816-cff5-4048-a875-53614148ed77","resolution":{"observed_at":"2026-08-07T14:34:57.123628Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 6 inbound Pith citation observations for arXiv:2505.18531."}