{"as_of":"2026-08-18T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b7e0dc583313e1c5708028540346119273c29f3a02fe7651b26c50ad7ac02be","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:39:02.891861Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09492/citation-record","integrity":"/paper/2607.09492/integrity","json":"/paper/2607.09492/citation-record.json","paper":"/paper/2607.09492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18037","last_updated":"2026-07-03T01:59:26Z","snapshot_observed_at":"2026-08-15T05:22:07.001069Z","submitted_at":"2026-02-20T07:32:22Z","title":"Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18037","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Gradient regularization prevents reward hacking in reinforcement learning from human feedback and verifiable rewards.arXiv preprint arXiv:2602.18037, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2602.18037","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:bb22053753a3999a7de5546c2564d6b0ccfdb87f8ed1ec87beaf543bcd3e9317","observation_id":"98e28a32-3613-4523-8981-671e83992518","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:dbaa4d86ccd8b964bcbe49414d647ff9894763b89bfd5aec227648cc16dea77d","observation_id":"989bcdf5-0de4-43b0-9795-c4cc8a4a341e","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11800","last_updated":"2025-08-15T20:50:53Z","snapshot_observed_at":"2026-08-15T17:28:15.425613Z","submitted_at":"2025-08-15T20:50:53Z","title":"Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11800","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Uncalibrated reasoning: Grpo induces overconfidence for stochastic outcomes.arXiv preprint arXiv:2508.11800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2508.11800","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:d496bcaaa32aaf213f36998aef201f5ed18076f563d62a7e06d1008a97a01a4d","observation_id":"b803a01d-d71b-4ad8-9af4-bf3bdf8b73e2","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-16T15:20:31.922471Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01368","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Activation reward models for few-shot model alignment.arXiv preprint arXiv:2507.01368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2507.01368","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:ea267e612d41090b277ddb3feba07b1178570833ab81ab71e0509de5ea9ed5f1","observation_id":"e10fc225-4be8-474f-9947-e9332a7ffc41","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10623","last_updated":"2026-06-01T09:37:25Z","snapshot_observed_at":"2026-08-15T10:39:57.964259Z","submitted_at":"2026-02-11T08:14:11Z","title":"Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10623","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mitigating reward hacking in rlhf via bayesian non-negative reward modeling.arXiv preprint arXiv:2602.10623, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2602.10623","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:112565f1488cf1db89aee8c000bbabd0fd8463fd3be1a5ccf3a42c892fa01405","observation_id":"81dcee44-4941-42a0-b217-466f5710df25","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Reward shaping to mitigate reward hacking in rlhf.arXiv preprint arXiv:2502.18770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:75c3ab1ed1ec2589568a044f9f60d485249ecf5d723a177df8dd614f49fa908e","observation_id":"a690e0b1-254d-4082-b2e0-b90008597f32","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04266","last_updated":"2026-05-05T20:01:36Z","snapshot_observed_at":"2026-08-01T01:52:21.623300Z","submitted_at":"2026-05-05T20:01:36Z","title":"Explaining and Preventing Alignment Collapse in Iterative RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04266","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Explaining and preventing alignment collapse in iterative rlhf.arXiv preprint arXiv:2605.04266, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2605.04266","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:50134abe4a6c6e29fd2f9ce56e51ff67aa17789caafefbbf41957f7e7f1d1692","observation_id":"81d5aaa8-a6b5-4379-9f87-0dd63c65de62","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07594","last_updated":"2024-06-13T11:22:15Z","snapshot_observed_at":"2026-08-16T13:44:10.660651Z","submitted_at":"2024-06-11T13:41:33Z","title":"MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07594","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mllmguard: A multi-dimensional safety evaluation suite for multimodal large language models.arXiv preprint arXiv:2406.07594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2406.07594","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:f181230a6011c6cdd1f28337311e903e4543a0b6734289b158226b8ee3110feb","observation_id":"e86380e1-428a-4313-a5db-658686382711","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:858b0a1a600ae4d477d4fe495796fa83d8639064354772ed97ec760412a2e729","observation_id":"fab4614e-9f91-44a7-b576-41d2c481902b","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Asymmetric prompt weighting for reinforcement learning with verifiable rewards.arXiv preprint arXiv:2602.11128, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:9ef01c164b282a7950e6ee1e8636fd639c79c57a957b6f8601e0a4c1178f56eb","observation_id":"c936a3e9-5eda-47b6-9c73-3cb465a1e1ab","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05113","last_updated":"2025-06-06T17:08:12Z","snapshot_observed_at":"2026-08-16T13:45:04.170712Z","submitted_at":"2024-06-07T17:44:32Z","title":"LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05113","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Llavaguard: Vlm-based safeguard for vision dataset curation and safety assessment.arXiv preprint arXiv:2406.05113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2406.05113","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:f18e39061beaae72e2844e6ca28373cbecff79c5ee0211509a1bfeae2b87ad86","observation_id":"13954728-6ead-44de-afac-3b708726e0e9","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Understanding reward hacking in text-to-image reinforcement learning.arXiv preprint arXiv:2601.03468, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:c114d49902fa6c338d6153ce600cb0dee19f65f8e13fa8ba6c31e3b9d3db4090","observation_id":"70bf175c-0ac3-48b3-a38f-105623e39543","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-17T19:34:58.995686Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19939","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Vlsbench: Unveiling visual leakage in multimodal safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2411.19939","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:1994f4906b766d4231a438928c59e334725c60df433a7be9b45eb1f8a46a6942","observation_id":"b957c2fc-4eb6-4b63-9e60-e1234846fbef","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:ddcc30ce9778d32ff562710981e225d397c6d0cbec61478d2493ae861f2a045f","observation_id":"af3c69c6-1b36-49f1-9d6a-e39212d688f9","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Do post-training algorithms actually differ? a controlled study across model scales uncovers scale-dependent ranking inversions.arXiv preprint arXiv:2603.19335, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:c6dd858b0339d0968ede67d87c35c86cb818c08c95c151edb26c84e94973faa1","observation_id":"e33ebfd3-bf91-48b1-973b-30b302a84393","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17600","last_updated":"2024-06-19T08:32:14Z","snapshot_observed_at":"2026-08-16T14:39:16.502919Z","submitted_at":"2023-11-29T12:49:45Z","title":"MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17600","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mm-safetybench: A benchmark for safety evaluation of multimodal large language models.arXiv preprint arXiv:2311.17600, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2311.17600","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:8da34380f6b3c6bc317f428b9cfd50fa2f6070352449344f24a1ab45b55fc8d0","observation_id":"ae4585a0-8ee6-4de5-8166-64b791b8b3c7","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12086","last_updated":"2026-04-13T21:47:49Z","snapshot_observed_at":"2026-07-06T23:00:22.690154Z","submitted_at":"2026-04-13T21:47:49Z","title":"Robust Optimization for Mitigating Reward Hacking with Correlated Proxies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12086","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Robust optimization for mitigating reward hacking with correlated proxies.arXiv preprint arXiv:2604.12086, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2604.12086","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:201afc5aab728f7eb36e85ee9c77c8904c872e99007f802124035e088cf6630b","observation_id":"e5325547-b6a6-435c-a3ef-e33544c56a13","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02269","last_updated":"2026-05-04T06:22:22Z","snapshot_observed_at":"2026-08-15T02:54:09.259804Z","submitted_at":"2026-05-04T06:22:22Z","title":"Towards Understanding Specification Gaming in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02269","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Towards understanding specification gaming in reasoning models.arXiv preprint arXiv:2605.02269, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2605.02269","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:bb1285193ecb52c407ee4f8b7ca47d0e8b55d67b84ecdee376f846c8342cd511","observation_id":"1c2de78b-0ff2-476e-8e7c-d91bc774fd53","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:a90544ecc08f5bdda70ecfc33f6c8950e552c15c6713b27f39e7dfef80f96e37","observation_id":"d63009a5-00f2-4d18-8539-4c9220bb4e67","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Vlsu: Mapping the limits of joint multimodal understanding for ai safety.arXiv preprint arXiv:2510.18214, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:6cc44bd7170929cb6f6fc90c5628490e6ccf9705d1b85eb778403d7113280811","observation_id":"719d72d7-ac1f-485e-8b2a-94f98c9cc9d9","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06717","last_updated":"2026-05-25T07:56:54Z","snapshot_observed_at":"2026-08-17T13:12:03.633540Z","submitted_at":"2026-02-06T14:07:30Z","title":"F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06717","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"F-grpo: Don’t let your policy learn the obvious and forget the rare.arXiv preprint arXiv:2602.06717, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2602.06717","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:189d98e65fc37d5099a01a13254a446498c2918aeb860f8b3a1d2e41c18d0743","observation_id":"54d53086-71b7-473c-9c25-edc013723e3c","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Dual-bench: Measuring over-refusal and robustness in vision-language models.arXiv preprint arXiv:2510.10846, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:6da8078deb59df1638c65875fb8f9ac4f51554c1fead563b0440e23dcfca46d0","observation_id":"85d40aca-881f-4b06-930a-cf98078d1f2c","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10057","last_updated":"2025-01-17T09:22:35Z","snapshot_observed_at":"2026-08-17T16:43:21.444345Z","submitted_at":"2025-01-17T09:22:35Z","title":"MSTS: A Multimodal Safety Test Suite for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10057","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Msts: A multimodal safety test suite for vision-language models.arXiv preprint arXiv:2501.10057, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2501.10057","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:671cf77c3210b23659dd12858089929caa8ec7de6a68dfbb677537aa5ff4f637","observation_id":"2730f344-ed6c-46c2-9375-f2c98d0c3b49","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-08-17T05:38:18.765737Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25872","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"When errors can be beneficial: A categorization of imperfect rewards for policy gradient.arXiv preprint arXiv:2604.25872, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2604.25872","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:4a6708f067f28149969f111c3919a00a662be226a15590e18dd12d7840c71d76","observation_id":"28af7302-b8f7-4f48-885d-77815d82bb5e","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:bd8282f34395ebb554d89b7d11bfc4d09f6489a0adf3d05b1cfb311279a68f74","observation_id":"353c0b54-a1fe-4d06-adee-9740cc3fc99d","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:92ccfc8ed3343aa6709f5bb7394cfa3279affe99b7bb6706f9732cdc57db8140","observation_id":"17ae3cd7-bf58-4e2f-9530-8ab6beb21f43","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"More thought, less accuracy? on the dual nature of reasoning in vision-language models.arXiv preprint arXiv:2509.25848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:d7d62e2389937528a7393ee9e6986bac927ef9fbb00e65ecd060ac461238e03b","observation_id":"7baf18ef-4dc7-4f3e-b099-16ab009f7235","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Reward hacking as equilibrium under finite evaluation.arXiv preprint arXiv:2603.28063, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:262095bf9a8a4bfc38b7fd9c1c2a35447f38de7dd58885b82cbfe0388a08fe0c","observation_id":"feb8187c-4b4f-4e6b-8b62-1bb1f0fde0a9","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-18T06:14:17.992551Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Reward hacking in the era of large models: Mechanisms, emergent misalignment, challenges.arXiv preprint arXiv:2604.13602, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:f946c9a0af868d43c78638ea3b735a90165b6d3abc05061e191d25dedccc8dbc","observation_id":"2c18de61-e383-4132-824b-f5493ab66445","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20751","last_updated":"2026-04-20T06:12:09Z","snapshot_observed_at":"2026-08-15T08:35:23.989525Z","submitted_at":"2025-08-28T13:11:24Z","title":"Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20751","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning.arXiv preprint arXiv:2508.20751, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2508.20751","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:2aa839987b6562c9b491ebbd2d40530088a31de40e17f4c1fd0545c45a3bae7d","observation_id":"33923cdc-e4b2-4088-a9a4-ca2fdce2db17","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-08-17T22:15:08.630152Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Unified reward model for multimodal understanding and generation.arXiv preprint arXiv:2503.05236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:32f87711f152045fc148d7f64809b8b94a007dc454de1b6f8d1e30c414478355","observation_id":"df465da5-d28d-494a-a698-dd6bded7867e","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Demystifying reinforcement learning for long-horizon tool-using agents: A comprehensive recipe.arXiv preprint arXiv:2603.21972, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:a6cd27e58f05417e48c267f5a3a7e96e3bd6f56092a6d6473797f924b1715e33","observation_id":"4da04be5-7438-4715-a148-4cc556097ceb","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-08-17T13:44:45.586270Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06650","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Beyond negative rollouts: Positive-only policy optimization with implicit negative gradients.arXiv preprint arXiv:2605.06650, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2605.06650","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:4140cf7b46356d67d83bb2fbb8c3a543410c0d2039eddea709cec3b507ff169d","observation_id":"a4480743-638b-4363-9214-561a3a1f912c","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15360","last_updated":"2024-10-16T14:56:15Z","snapshot_observed_at":"2026-08-16T13:17:39.160528Z","submitted_at":"2024-09-18T02:35:41Z","title":"Reward-Robust RLHF in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15360","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Reward-robust rlhf in llms.arXiv preprint arXiv:2409.15360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2409.15360","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:1a86db488f1d62cfcbe6628ea72e477450751a15c723abc4bc43d70c5a6c9d76","observation_id":"be211758-972e-4e32-bb4f-70a2031c0cdf","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-11T01:41:29.576397Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04077","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Balanced aggregation: Understanding and fixing aggregation bias in grpo.arXiv preprint arXiv:2605.04077, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2605.04077","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:547233c17d6aa35b06dcb5726d0e1ded420b273d19c2550f9401f5e27bab9b19","observation_id":"419567d6-c8b2-4ee9-907b-633a9b827c4d","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models.arXiv preprint arXiv:2512.07783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:4b490c202c53fe877485bceb59e1448c02a308393634a2b3ebeec1bfc427e809","observation_id":"566278fa-5327-46a9-8c1b-24dbefcea74a","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Perceptual- evidence anchored reinforced learning for multimodal reasoning.arXiv preprint arXiv:2511.18437, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:53a0a8ac4ed1eb1111ecd8e24b4b0cf1df5d8896be7a78154832f655406181e6","observation_id":"d17dbce2-9757-417a-a4be-0faecb977c04","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Basereward: A strong baseline for multimodal reward model.arXiv preprint arXiv:2509.16127, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:82afea0413b3eaa709f76e04ae2d676de04c41dec083d2a35809ccd88ab5f633","observation_id":"c8b87b09-ab46-4255-ab5c-a7f29394c6ac","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-17T15:53:34.369922Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:7af53b4dafea735c02ca7d1da638c15d6731c239cd89178e305e065b170cfe52","observation_id":"af9dee90-b69b-43f7-91f5-af013c095807","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-17T05:28:50.285614Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:0a6507ef19421ea88686b99465a1464b98dcbb230afeffa90980e811405f750f","observation_id":"b2e385e7-cee5-4c69-be4b-fe72760b647b","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference.Advances in Neural Information Processing Systems, 38: 126021–126051, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:cfa168148ee7b5d8a195feaba8d1ddcd62cfb41fe4c62f0f60d64a99333d1e44","observation_id":"1b5357ef-6ce3-4e4c-ac83-faa07bdb96ad","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Omniguard: Unified safety moderation for omni-modal inputs and outputs.arXiv preprint arXiv:2512.02306, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:fdd2d4f3a4631ac17c411d35c1472caff3cd53e6ef7965a43ca35c50bb6aae90","observation_id":"9c0eea38-4d5d-4bf1-9421-d4122a1bd893","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-14T11:41:11.089540Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04371","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Perpo: Perceptual preference optimization via discriminative rewarding.arXiv preprint arXiv:2502.04371, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2502.04371","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:2afe0679801291ced1a047d816f9dc3074292135aefcdac0e5c5acd6f16b909f","observation_id":"92a31e26-55e3-49f4-9243-7361b6e239b9","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:ce0699f3a7a0ba92afaa1ce53ca822045c5bf190ba88f62f263a715f61f3e8b1","observation_id":"dcb14c7c-e4f6-41f4-9f02-60eedfa91705","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:17f0d05e3ab92b8ac566ad0abbeeba767f11505c9e03a11b2a350f8a1e599870","observation_id":"e555e2ac-a863-4f8a-9677-f1caf23279f4","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:c751120d687695d5569ef14240f846992224d20b837f49cef091b87ca7207607","observation_id":"b05cf399-1f75-4e76-a7e4-e435aef1a43f","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"I cannot assist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:d9ddd36647e915eb8acca2bf4b92db2a70a90225c281ae3e74ed6be834a63709","observation_id":"c28e247b-dde4-4535-8bf2-02e73727302c","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:7efc522d0d8a9d9f9f463231a34933c97a38c2579ceb298710e54c36432bc13f","observation_id":"064cb242-0dfd-4406-a6f8-84b808095b7a","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"label”: “Yes — No — Invalid","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:70aeb4e2d2b0ad09f26699fc71af89f52b80a792b67779cc52564305c1966c06","observation_id":"1feeb64e-dc81-4782-9377-6a7085900d28","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:eb8103b2a7662b2a106f1c4ba8c11da6e79466efec38b7821441897f8c10eca1","observation_id":"ba1655dd-751d-4878-b080-89785fa014d6","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:ae92b2f8eafae1e7aff70d8b3d64ecc7b66a257005512fe85edd1c4775fa63f7","observation_id":"3c050b4f-3006-4fa4-8d8e-5e6cfef03e44","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:c901768625e3a4d335d7fe622cd94a0191e24c5d3358a9dca39b1e0751f47385","observation_id":"5eaeca36-6819-4e41-a019-bbb477199133","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:54ae70fe152f1426d1745ea7720a1f32d11cf3192d8d38a2e5dea8e0c49d5143","observation_id":"e7f5d96d-5fd2-4c19-9a49-a66983734f14","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"sft score","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:5ba17c64ae02791879a92136344c8997eb9d45d298a2afc1c5d0739f2a678f6b","observation_id":"be453a2d-5fed-4e16-9134-5838b9456212","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:e71f356dd7bcf9e6748c2da472f2480d0d80004868f5a5ffa65266f00d634d11","observation_id":"aeff1747-e8a9-4de2-b986-59d9dc8b7d03","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"I cannot assist. The image contains knives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:3d3e9c8fc48f64348430b1498e23c79d85f33b4ba7ef4b867296e2ba80f5fe66","observation_id":"ddc2ca65-285d-4adf-adf6-73c70c993a70","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:cfca0488f0ecabdf2c286e2bf6685f9e42231238eba1992f2f779f76515873ee","observation_id":"eb47c47a-30e2-4c5d-b2e1-8a47747ea30c","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"I cannot help with this request because the image shows instructions for making a weapon, which I cannot assist with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:e91a5693fa5dd20eaac9410c4aab46ee6d43d8c6277451a1ba597ebe001aa57a","observation_id":"12a10d9a-3a22-4452-8e9f-82be29fc6eff","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2607.09492."}