{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:H43HPSP6B6YQP32GQ43ZGP2JQN","short_pith_number":"pith:H43HPSP6","schema_version":"1.0","canonical_sha256":"3f3677c9fe0fb107ef468737933f4983548d62e988f337d46b267e923acfccf8","source":{"kind":"arxiv","id":"2509.00676","version":1},"attestation_state":"computed","paper":{"title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bo Liu, Chunyuan Li, Furong Huang, Jianwei Yang, Kai Zhang, Tianyi Xiong, Xiyao Wang","submitted_at":"2025-08-31T03:08:02Z","abstract_excerpt":"In vision-language modeling, critic models are typically trained to evaluate outputs -- assigning scalar scores or pairwise preferences -- rather than to generate responses. This separation from policy models, which produce the responses, is so entrenched that critics are rarely considered for direct policy use. In this work, we challenge this convention. We propose to reorganize preference-labeled critic datasets into verifiable training signals and perform reinforcement learning directly on a base generative model, producing LLaVA-Critic-R1, a multimodal critic trained to optimize preference"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.00676","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-08-31T03:08:02Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"69ceae8cbbd9c773125083aaf59b701fbf4c14b04aeda9cc15d43770e3d57285","abstract_canon_sha256":"93e7ae963b1cfd826fafcea4a7600aff7cd9f49cbc2e2d4c19520cdc8d76e81f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:02:20.886151Z","signature_b64":"/HayfdLoCiHM0doABpmDcyNZaArWbV7OLYPmCH5eSQF/5V4qCEWbYV17t4ReCO0HM1IQ0/ugI9wpQZ6HoqdTBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3f3677c9fe0fb107ef468737933f4983548d62e988f337d46b267e923acfccf8","last_reissued_at":"2026-07-05T12:02:20.885715Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:02:20.885715Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bo Liu, Chunyuan Li, Furong Huang, Jianwei Yang, Kai Zhang, Tianyi Xiong, Xiyao Wang","submitted_at":"2025-08-31T03:08:02Z","abstract_excerpt":"In vision-language modeling, critic models are typically trained to evaluate outputs -- assigning scalar scores or pairwise preferences -- rather than to generate responses. This separation from policy models, which produce the responses, is so entrenched that critics are rarely considered for direct policy use. In this work, we challenge this convention. We propose to reorganize preference-labeled critic datasets into verifiable training signals and perform reinforcement learning directly on a base generative model, producing LLaVA-Critic-R1, a multimodal critic trained to optimize preference"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.00676","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.00676/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.00676","created_at":"2026-07-05T12:02:20.885784+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.00676v1","created_at":"2026-07-05T12:02:20.885784+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.00676","created_at":"2026-07-05T12:02:20.885784+00:00"},{"alias_kind":"pith_short_12","alias_value":"H43HPSP6B6YQ","created_at":"2026-07-05T12:02:20.885784+00:00"},{"alias_kind":"pith_short_16","alias_value":"H43HPSP6B6YQP32G","created_at":"2026-07-05T12:02:20.885784+00:00"},{"alias_kind":"pith_short_8","alias_value":"H43HPSP6","created_at":"2026-07-05T12:02:20.885784+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25034","citing_title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25571","citing_title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2606.25034","citing_title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2601.22297","citing_title":"Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2512.21815","citing_title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05922","citing_title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20705","citing_title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19544","citing_title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07872","citing_title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05117","citing_title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","ref_index":48,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN","json":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN.json","graph_json":"https://pith.science/api/pith-number/H43HPSP6B6YQP32GQ43ZGP2JQN/graph.json","events_json":"https://pith.science/api/pith-number/H43HPSP6B6YQP32GQ43ZGP2JQN/events.json","paper":"https://pith.science/paper/H43HPSP6"},"agent_actions":{"view_html":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN","download_json":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN.json","view_paper":"https://pith.science/paper/H43HPSP6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.00676&json=true","fetch_graph":"https://pith.science/api/pith-number/H43HPSP6B6YQP32GQ43ZGP2JQN/graph.json","fetch_events":"https://pith.science/api/pith-number/H43HPSP6B6YQP32GQ43ZGP2JQN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN/action/storage_attestation","attest_author":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN/action/author_attestation","sign_citation":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN/action/citation_signature","submit_replication":"https://pith.science/pith/H43HPSP6B6YQP32GQ43ZGP2JQN/action/replication_record"}},"created_at":"2026-07-05T12:02:20.885784+00:00","updated_at":"2026-07-05T12:02:20.885784+00:00"}