{"as_of":"2026-08-09T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:684e54342d3d2202888781d2cf12ddb7e277105fa54b885d23ef85cc3d657662","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:37:00.301396Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:12:18.190583Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T03:45:58.423192Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00484","snapshot_observed_at":"2026-08-03T09:12:18.190583Z","title":"w/o trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.190583Z"},"links":{"cited_paper":"/paper/2509.00484","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:55b28c1577e9956b040d7cd9a89488825c7aef21cde331d0338c58b6cda4b0e3","observation_id":"b67f1f99-ad3a-43e0-975b-10d945926009","resolution":{"observed_at":"2026-08-03T09:12:18.190583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"cited_work":{"arxiv_id":"2509.00484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00484","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"369b8ea6-5bf4-4d7a-aadb-99856ab29026","year":2025},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-04T19:38:15.330922Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2509.00484","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:4daf3fa94803c646a40cc6882c9a5bdfeec173134f5234679dee28c1b0797bfd","observation_id":"85a1b947-7ccc-4cf7-9702-476b1f28f9cd","resolution":{"observed_at":"2026-05-11T03:45:58.426040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00484/citation-record","integrity":"/paper/2509.00484/integrity","json":"/paper/2509.00484/citation-record.json","paper":"/paper/2509.00484"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:12.162864Z","title":"Phi-3 technical report: A highly capable lan- guage model locally on your phone, 2024","venue":null,"work_id":"12324782-70d5-4c59-bb6b-21cbd2cd6144","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:55.685164Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:06d8f0d41a78ef5e25a0ed53e373d0fbe61a0b98ff3bdd2253fee467b4137d27","observation_id":"c4f6cb42-b89a-43b4-b278-7082640825dd","resolution":{"observed_at":"2026-08-05T13:37:12.259469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.994087Z","title":"Claude-3.7-sonnet","venue":null,"work_id":"18042c1c-5f4c-4e85-9a3b-3dc920b51230","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:55.776050Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:c7c45e54f1c8631ba4f22fab6888ded518730a49e55f64a443cc25917dff481c","observation_id":"e94cf7cb-74d9-45c1-87d5-acfb09d28294","resolution":{"observed_at":"2026-08-05T13:37:12.073331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.869260Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"52facb17-94a9-43ee-bc44-93e387c2937c","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:55.881039Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:74d9479af90acff7df765ae3c86c1d00b04cc53c3dc8e34461058b69642f6a72","observation_id":"c7ca1495-48b3-4dfe-b77c-81d475bd9ab4","resolution":{"observed_at":"2026-08-05T13:37:11.928079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.643210Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark","venue":null,"work_id":"3e9de2a2-7092-44ef-9622-c2be7cfb95fc","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:55.992017Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:5c48b61c70575bc6a1872b4a4bd5983c56c1c670d9ad67b4e2e5bff5dc78cd7d","observation_id":"5915fc07-4818-4255-af09-a49ab2e26d7f","resolution":{"observed_at":"2026-08-05T13:37:11.766552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.440405Z","title":"From captions to rewards (carevl): Leveraging large language model experts for en- hanced reward modeling in large vision-language models,","venue":null,"work_id":"21e60b6b-a9b5-4305-8a5a-3112b1665379","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.109886Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:6423ae77c33834e07e5e390b84bde1030553c99d26a72f947f6dceb3cb156d0c","observation_id":"ff2e0499-c770-4847-af77-bff4b4272419","resolution":{"observed_at":"2026-08-05T13:37:11.523436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.315820Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":"25505952-0e48-49dd-9fe6-64d642536053","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.240599Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:3417def2e560a40b7985e516ef0e88b09a6cb30f88516e1c22801301f918afdf","observation_id":"458599d7-441e-49c8-9027-5eaadcfd82f2","resolution":{"observed_at":"2026-08-05T13:37:11.375281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:11.129978Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in 9 video analysis","venue":null,"work_id":"5397544d-0f4a-4778-bb99-6311a001235e","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.367900Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:0f100dbd941f4f9ba5c0fedceac8d3d3f39f7bcf7bfd23b753274479787fdaaa","observation_id":"35785f6a-bbaa-4cc6-a1bf-9492b07eec96","resolution":{"observed_at":"2026-08-05T13:37:11.235012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:10.911305Z","title":"Gemini 2.5 flash, 2025","venue":null,"work_id":"984fcadf-c027-4e1c-91e9-c7275cdfa999","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.552682Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:153c16864f1fa181fe08900c6451996954dd5313d05654194c4b5cc240bfecaf","observation_id":"815a0060-ae0c-4654-93e8-1f18529321d6","resolution":{"observed_at":"2026-08-05T13:37:11.009206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:10.726251Z","title":"Gemini 2.5 pro, 2025","venue":null,"work_id":"0172cf24-8a36-419f-902c-52d0e4fd0fe9","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.711262Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:52ea252e9aeb482aae7486ad89306a2894555a57764a2bc7dfc947d86c590f92","observation_id":"9a0723b1-0a7a-4fcf-90d8-62cd592b9499","resolution":{"observed_at":"2026-08-05T13:37:10.806655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:10.543034Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"61f0f1b4-26e8-41e9-a39e-e413775b3758","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:56.892327Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:feca542b3bba4985fd77e4f0b0b39efa378ff6c884d93c82eb159942b038114f","observation_id":"f147d787-2081-4768-bfc0-2a5f8439d302","resolution":{"observed_at":"2026-08-05T13:37:10.635204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:10.311964Z","title":"Mmworld: Towards multi- discipline multi-faceted world model evaluation in videos,","venue":null,"work_id":"d1d1d0a1-e7ac-430a-8458-7bb61dd2e721","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.078804Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:254902c04ca13783c56f478ce5c98d34a3bdc0c5d79b5d2b9446cd20d4925307","observation_id":"46713bf0-5af4-40a9-a194-5bd26af5e271","resolution":{"observed_at":"2026-08-05T13:37:10.417542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:10.047998Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline pro- fessional videos, 2025","venue":null,"work_id":"93f6ebd4-22ba-42fb-88c5-13c9c9a4ab59","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.173200Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:4ebbc62965b9dfa2ad347d85e91b924d56bb0ed67b3cf7da71a2befb5fc7a8af","observation_id":"6b80a8a4-4a30-46fc-b486-6b10d4d7e303","resolution":{"observed_at":"2026-08-05T13:37:10.146323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:09.820845Z","title":"Flex-judge: Think once, judge anywhere, 2025","venue":null,"work_id":"0352a821-d556-4f94-9355-6f4f9b60d152","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.228365Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:458599627575a274db3930fad809fa14ba89d64d41800973057c0d3b8a82ba1d","observation_id":"0a1592f8-5a7b-4c9e-9f7f-3d6f256a387f","resolution":{"observed_at":"2026-08-05T13:37:09.988035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:09.563319Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":"03f67fea-5486-46df-a1a8-f54fa9e395c2","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.349655Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:d6634651bf942885b3458d6bf33d6dd7c1ea176364410252b45c8613582f9663","observation_id":"464475ca-6ce4-4df4-ba44-0c3398e8f56f","resolution":{"observed_at":"2026-08-05T13:37:09.666185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:09.229115Z","title":"Vhelm: A holistic evaluation of vision language models","venue":null,"work_id":"d204e87b-15cb-4ce6-8502-cd3d8a4b702a","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.467162Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:801ba76d3140505f8b498c67f44b421a62cb6bd1bc49e6b7ad31880247244004","observation_id":"7c133eb4-541b-4797-93b6-8be641df03cd","resolution":{"observed_at":"2026-08-05T13:37:09.379423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:09.004458Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":"1f1f1894-becd-4e03-aa1c-16c55cf93747","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.548201Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:522fae090eddf96c961f291a8f40e289b693a27e3f7e14888aa6d85b1b14a649","observation_id":"98ca7ad7-047c-4738-b074-a748151bdfd1","resolution":{"observed_at":"2026-08-05T13:37:09.103447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:08.727189Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":"5f66f760-1211-459c-b42e-dafa04b8fd22","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.633679Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:845235d103380889721e837146164949106d1d2cbd6f3707d9f8bdc858188e13","observation_id":"5e0806f5-8935-4239-b0a0-74bb98530c8e","resolution":{"observed_at":"2026-08-05T13:37:08.862974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:08.477843Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"bf84be1f-edd2-4f38-9a63-849fbb4e00e0","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.723527Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:d10af0cc3ac7d6321800597048a9d7c2e9e5e0ca32c116672260a74a75f9b684","observation_id":"27ba31a1-08a6-4816-86bb-1ece49a1a1ed","resolution":{"observed_at":"2026-08-05T13:37:08.614241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:08.222461Z","title":"Vl-rewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":"5cb4a9a7-660f-4951-b932-914f35cc99b1","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.752949Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:357d843e2555593b0bf3255f1f920df536422bc58ce78aa25d229ab95243624f","observation_id":"e2e7aee3-320c-4b6e-acb2-dca4c9ec5f35","resolution":{"observed_at":"2026-08-05T13:37:08.362228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:07.966545Z","title":"Holistic evaluation of language models, 2023","venue":null,"work_id":"6052a4b7-a5e4-4d38-b864-03ba7d1136fa","year":2023},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.836035Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:4d042dbd1e9b844a8aebe9b2d447410c60cbece184a20df39d756e0cc0a8792a","observation_id":"0f641bec-ef5d-4e35-b963-eb12b8510092","resolution":{"observed_at":"2026-08-05T13:37:08.084903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:07.628929Z","title":"Video- safetybench: A benchmark for safety evaluation of video lvlms, 2025","venue":null,"work_id":"d70a2b9e-dae7-435b-8173-bb0a30cadfac","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.896073Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:6a9b3a565a30edecb24efcf084cb4e01218b93e04405b5d133c8fc031018292e","observation_id":"b3d25fb7-0624-470d-aa62-27254b37cfd4","resolution":{"observed_at":"2026-08-05T13:37:07.780040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:07.372550Z","title":"Rm-bench: Benchmarking reward models of lan- guage models with subtlety and style, 2024","venue":null,"work_id":"8a365173-4705-4776-8bb4-716fc7964c20","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:57.968346Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:ff4f2122609d55147b515790b3c2a778efdc5b8661b9d2097046337135bff19d","observation_id":"98d78dd1-154c-4bec-a7e5-98f16ac30b4b","resolution":{"observed_at":"2026-08-05T13:37:07.501117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:07.037689Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding, 2024","venue":null,"work_id":"709fec8c-0098-4857-a091-040d82b70d20","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.052845Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:58849f26e02923e132c0a4c7de46323d7337b4bb8bf288eccc40514eb208268e","observation_id":"84c079c1-9c8e-45f8-88ab-dc640f1875a1","resolution":{"observed_at":"2026-08-05T13:37:07.237524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:06.793150Z","title":"Smith, Hannaneh Hajishirzi, and Nathan Lambert","venue":null,"work_id":"66735596-4821-4464-a01e-c8e212af02f6","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.086443Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:93a2b56c0358967a0877847de6f18450295cd5995a7a3755f6e0f45a33bf35d3","observation_id":"0e34abe0-122c-4574-b29c-40ec34abdf74","resolution":{"observed_at":"2026-08-05T13:37:06.920168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:06.564646Z","title":"Hello gpt-4o","venue":null,"work_id":"23bda9c7-8544-46c5-acc0-1c6b84c6b14d","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.146528Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:16de4ac29583e3505e9f2d451aa59659225f9c22fbb6f04c8b00d92df39b01a7","observation_id":"c6042620-dd95-4a61-8c82-05f9793f1ca9","resolution":{"observed_at":"2026-08-05T13:37:06.677472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:06.314295Z","title":"Gpt-4o mini: advancing cost-efficient intel- ligence","venue":null,"work_id":"e9e8fa3e-3353-4fad-a566-75377581e0c6","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.200367Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:cc0db3c7408405434621f22082fd183c68daef49600a0c5d3b988a414c7f8887","observation_id":"6bf86790-0c14-48f3-b2db-25ecedcd3c29","resolution":{"observed_at":"2026-08-05T13:37:06.448524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:58.250334Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.250334Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:aa2c19e0c8d490b58d348ca26934fa8814e919907b0320e9561b1cd4b60f021f","observation_id":"6f9cb145-28d3-4e6d-85a5-1bcc0d88753b","resolution":{"observed_at":"2026-08-05T13:36:58.250334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:06.008163Z","title":"Vibe-eval: A hard eval- uation suite for measuring progress of multimodal language models, 2024","venue":null,"work_id":"382b7b7a-fcce-47ad-b21a-8c3a25c7d385","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.299362Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:44bd25294591c85c7173acbee63e5979366fbfb9206995a32bf66d9daeb9ae44","observation_id":"890b82f9-9b86-4d9c-88a5-17fbb0b0c2ff","resolution":{"observed_at":"2026-08-05T13:37:06.158425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:05.777819Z","title":null,"venue":null,"work_id":"256f506c-2630-4c54-9f0d-e2d258850cf5","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.353204Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:f3d072f6b588e6399565c17f47efebc61e6afa68ba61b11e4a3cb71a1092ca66","observation_id":"e5b36f29-b815-469a-890e-d4050996fa38","resolution":{"observed_at":"2026-08-05T13:37:05.867135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:05.581739Z","title":null,"venue":null,"work_id":"7da9ee79-57c2-4121-b802-66765133f3ec","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.400638Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:314049c7ada7eae2f6677e5a287ffd254c051a8514725528acc2b6d51ddeb182","observation_id":"d3f52317-6b7d-44eb-b8b5-3ed8ba05952a","resolution":{"observed_at":"2026-08-05T13:37:05.688820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:05.350303Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"690c7903-6271-4b94-a232-02b440d85175","year":2023},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.443575Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:774d348901482e8689ae442d6df4437efc7f6ae44912d42465cca6f96f2cc8a5","observation_id":"83617b98-f60b-49d7-b30a-d613979447b1","resolution":{"observed_at":"2026-08-05T13:37:05.473882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:05.151293Z","title":"Scaling llm test-time compute optimally can be more effec- tive than scaling model parameters, 2024","venue":null,"work_id":"4e656502-725b-4a5d-b863-425e44e9038e","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.489898Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:b8bd01a1006ef494b803be49ade1cb7a334f3e0ed1886c73531b271a5e7a6fd7","observation_id":"36f21a8a-9fe1-45cb-9dec-68ae68bd6cbc","resolution":{"observed_at":"2026-08-05T13:37:05.255319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.980033Z","title":"Aligning large mul- timodal models with factually augmented rlhf","venue":null,"work_id":"79315230-43f8-40b8-9b04-ff7631543a13","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.571167Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:1a1e8528a75e3cc6c922fcb01aa2a0366def259e31601457a3198b85c1a802ca","observation_id":"7126e7c9-d619-4a1a-9a8f-c9fb22f570b3","resolution":{"observed_at":"2026-08-05T13:37:05.057724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.741223Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"f6df404f-a799-496c-8fbd-b0d9303cab7d","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.657428Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:19154b683375a228ad8efbfbcfc92a00d4192c3971ae2aec0b1980e9ee7a83ed","observation_id":"67911071-2d2e-487b-9976-26b7bc9df062","resolution":{"observed_at":"2026-08-05T13:37:04.828772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.568490Z","title":"Visualprm: An effective process reward model for multimodal reasoning, 2025","venue":null,"work_id":"9b10fead-5c9b-4e06-8a33-b58a2507891c","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.728999Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:eedfcad10e3e75ce518278453ad3e69faa47671481ecb0cb6c261d4eb9e1ac26","observation_id":"8977e9be-1c7b-417f-9469-318b75a1d9ea","resolution":{"observed_at":"2026-08-05T13:37:04.645184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.358289Z","title":"Skywork-vl re- ward: An effective reward model for multimodal understand- ing and reasoning, 2025","venue":null,"work_id":"6cc260c9-8518-4774-9a3b-09e405f847a1","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.764352Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:bf15cf18dde716b85034d00d8e1b05456a1d9c904f4303889e3c06ea77e95f8c","observation_id":"d15c199f-cb9d-4b60-b885-5527adb7502c","resolution":{"observed_at":"2026-08-05T13:37:04.470201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.222408Z","title":"Videohallucer: Evaluating intrinsic and extrinsic hallucinations in large video-language models,","venue":null,"work_id":"d280965b-f58e-4b6f-92c3-290abc86c173","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.825448Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:fccc768e338b7be42c0577ff58a5f6561707ec8177eb64b068d9a4caa015e08b","observation_id":"fadbf3fa-85e4-4c10-8c66-5827de2b86d9","resolution":{"observed_at":"2026-08-05T13:37:04.289915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:04.044860Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling, 2025","venue":null,"work_id":"fee5f39e-14d3-46ec-9386-9b618496235e","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.883194Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:421773dbfbbd4148ba25befa4b9591ee712b276814f388962372a8b771efb6eb","observation_id":"764544fd-5763-42c9-9c73-f8c0d29e2473","resolution":{"observed_at":"2026-08-05T13:37:04.111328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.891441Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine- tuning, 2025","venue":null,"work_id":"56b1bb9c-1837-4a8c-93b7-8e322a14fd42","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.926700Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:90486142f61d883e7bf07dd5315a76fe79af0f35a9dfb0b93939c1f967809434","observation_id":"261d4f87-715b-453d-ba4e-37e0ce250b29","resolution":{"observed_at":"2026-08-05T13:37:03.977219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.711394Z","title":"Unified reward model for multimodal understanding and generation, 2025","venue":null,"work_id":"5040e34e-4165-4ca6-b4de-1c009dbb182e","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:58.989270Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:174b1fce866b11a8a24fdfcba618f1a3ff03fb29579bc3464e683db5f106c008","observation_id":"be6f6f8b-4e21-4054-91a3-b5eb23fa6389","resolution":{"observed_at":"2026-08-05T13:37:03.829886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.564673Z","title":"reword- bench: Benchmarking and improving the robustness of re- ward models with transformed inputs, 2025","venue":null,"work_id":"fce603eb-69f8-46ed-be8d-9beb3cdbebd1","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.128058Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:fc44649f27fb78d61bd0f7b50959c09d73e11a5672d2ea8734d7f27f47a3e3be","observation_id":"b1340748-d163-4569-8cf2-7f7e62c61eba","resolution":{"observed_at":"2026-08-05T13:37:03.641007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.399678Z","title":"Llava- critic: Learning to evaluate multimodal models","venue":null,"work_id":"d4c7d699-690d-4cd8-b132-e3dd915f0ef5","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.239966Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:cf7877b28c35775efbc442bffc8ae6e3c103b02e7918d38896f5502dcf03d813","observation_id":"a3b188c3-f4bb-49fc-8167-943cb1724c22","resolution":{"observed_at":"2026-08-05T13:37:03.469920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.258991Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":"1163f4a4-6a78-462e-a9e6-1f8474644c4c","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.353315Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:af74bcfb197fe8b02299712fc72eff5fc1d7c62d947133cf820c09eea0f98e80","observation_id":"4d72ee90-a197-4dfe-9da4-becf901f93c4","resolution":{"observed_at":"2026-08-05T13:37:03.316493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.119496Z","title":"Minicpm-v: A gpt-4v level mllm on your phone, 2024","venue":null,"work_id":"0f1a4a63-ee1f-48d5-8521-942ede2dc123","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.433486Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:b9a16d9d9bbba583d7ed7b3dc736d7f37a7b62a462cc6a9f82b337987b5e1b28","observation_id":"5475c51c-cf2d-499c-9648-ceeaf6c12bd3","resolution":{"observed_at":"2026-08-05T13:37:03.192057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:03.022305Z","title":"Multimodal rewardbench: Holistic evalua- tion of reward models for vision language models, 2025","venue":null,"work_id":"f27f6488-1cb6-421f-9e7f-4ea837bc04ed","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.513332Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:d1edf98aeb5b452c2c76f38ec05261c595cc9513e4aa728b5ea066b4e5a9d6c3","observation_id":"0acb75a3-7223-4a1d-bdf4-067cc6752f96","resolution":{"observed_at":"2026-08-05T13:37:03.057857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.985729Z","title":"mplug- owl3: Towards long image-sequence understanding in multi- modal large language models, 2024","venue":null,"work_id":"5cd419f6-7ee9-4266-8bb7-a25cf92f3d5d","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.571232Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:064d284d0c8a5fe09b67cfa6494c242f9e1d5f4dd67cc5974dc35c19ad5b55bc","observation_id":"601e0b30-c8e5-4ebb-bdbf-6d04c41722a4","resolution":{"observed_at":"2026-08-05T13:37:03.000377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.860043Z","title":"Internlm-xcomposer2.5-reward: A simple yet effec- tive multi-modal reward model, 2025","venue":null,"work_id":"f281012b-2cbf-44ca-8477-0832d689366f","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.661912Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:fdacd15ff0ef49c5db8780ea7d0f82565016462db0dc3bfefed3fa847ce71000","observation_id":"fff5b201-f05a-416a-a0cd-f7f81c4c8b98","resolution":{"observed_at":"2026-08-05T13:37:02.910320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.709953Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"62f1c2b1-4050-4db7-bceb-f230b0452d5c","year":2024},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.755444Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:0b26cc96f3230414337e9c29e905e499940326495015346a7474ebdf83a1fd7f","observation_id":"6e28fccb-51f0-498a-b7ec-7ccd3f04d21f","resolution":{"observed_at":"2026-08-05T13:37:02.800246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.621906Z","title":"R1-reward: Train- ing multimodal reward model through stable reinforcement learning, 2025","venue":null,"work_id":"6791b31a-9c6e-405b-9f8d-c81705e698b4","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.815536Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:573cc2c4ffebf9308e2ce27244bbdff486862662a681a85f39f75c444c4924ac","observation_id":"d100f179-064a-4808-bcab-4546d9d6392c","resolution":{"observed_at":"2026-08-05T13:37:02.665649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.401220Z","title":"Mm-rlhf: The next step forward in mul- timodal llm alignment, 2025","venue":null,"work_id":"7a890d1c-6451-4927-b6bf-3c2a0792572e","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.848574Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:0eb4a31fcfac70f69d1565fff7d5683651d9af2adff6e99bb048bdb6654426c0","observation_id":"4d94a7f3-44f2-43b8-ab82-8e8bb70059ee","resolution":{"observed_at":"2026-08-05T13:37:02.524756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:02.203018Z","title":"Mmvu: Measuring expert-level multi- discipline video understanding","venue":null,"work_id":"f85e2953-7e58-493f-b6e2-faaba53f2ddb","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.879659Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:8588c0e05b2edd470ea62278cf6e20aab54fd0da336feed7ea7eaf04a827e36b","observation_id":"de729c4a-47e1-433b-b0ad-a1ff6cee003c","resolution":{"observed_at":"2026-08-05T13:37:02.304836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:01.978046Z","title":"Generative rlhf-v: Learning principles from multi- modal human preference, 2025","venue":null,"work_id":"d999d68d-198d-405d-83ff-35a6d71648a7","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T13:36:59.941132Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:be0460628ba1347c5371dd41e3ed0491186ece24c707d94b14cea2f17f0bc089","observation_id":"9d797eb8-6c3d-49e7-9467-33eb1fe8a745","resolution":{"observed_at":"2026-08-05T13:37:02.086954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:01.574773Z","title":"Input Frames","venue":null,"work_id":"e652250f-68fd-47b1-83cc-a7a21eefd822","year":2025},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:00.007216Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:077abda344a0c795a50dcf68b66f8439e685a4943763a981f9f664d2ef89d32e","observation_id":"d19521cb-91bd-47fc-89d7-b44065f3fdc1","resolution":{"observed_at":"2026-08-05T13:37:01.739502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:01.220764Z","title":"When placed in water, there is a violent reaction","venue":null,"work_id":"76ef6693-df3c-4d96-a709-ac64b43e8575","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:00.097372Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:3a7a51415ff37459a951183684af1bb9e0e96ab8d11ed9b49a3213faf250d76a","observation_id":"e337c64c-0f18-4685-95e0-eaae06bf12b8","resolution":{"observed_at":"2026-08-05T13:37:01.387620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:00.897105Z","title":"- Silver (\\\\(Ag\\\\)):\\n - Silver is a very unreactive metal and does not react with water under normal conditions","venue":null,"work_id":"6700997d-3047-4e53-8c4d-a529494c759d","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:00.166054Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:37ac86181b0916a2fb8af2bb685016961f71dc1d02217e818a735c3491f5de14","observation_id":"d92b6859-9d44-4444-94ba-8e7f4ae697f7","resolution":{"observed_at":"2026-08-05T13:37:00.984353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:00.679332Z","title":"- Iron (Fe) reacts with steam (not cold water easily in a simple setup like this video) and silver (Ag) is a noble - metal that does not react with water under normal conditions","venue":null,"work_id":"a1a54a04-e0cf-4a71-97fa-5507f446f6c9","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:00.236795Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:56bd86b26d826957a84f45e0593efa1db1395f822a286f8945aa8dcc62b4d8a0","observation_id":"d9ae3455-a6ed-4695-9bc7-0d6a12cc0ed0","resolution":{"observed_at":"2026-08-05T13:37:00.820297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:00.406325Z","title":"Also, when phenolphthalein is added (the pink - colour change indicates a basic solution), which is consistent with the reaction of alkali metals with water","venue":null,"work_id":"8d90201b-dcd1-465e-8f9f-21812040618f","year":null},"citing_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:00.301396Z"},"links":{"citing_paper":"/paper/2509.00484"},"observation_digest":"sha256:c1cc57d05834e267f14b12cfc35e6611226714583d9bef692623835c37cda101","observation_id":"ec53e020-5ad6-4f07-a864-0be5f63ac85e","resolution":{"observed_at":"2026-08-05T13:37:00.514904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2509.00484."}