{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23cbb7e20394bbc5a1b6949af7a551a04472a9f73851defb39182ab0a6235735","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:46.166368Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21252/citation-record","integrity":"/paper/2506.21252/integrity","json":"/paper/2506.21252/citation-record.json","paper":"/paper/2506.21252"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T22:36:41.369605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.369605Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:86812036096de3a85d0456313c59d09d82a7d6feb648b23de32d9a8824c21688","observation_id":"f06f09b6-722d-4be3-b938-e09a910cd995","resolution":{"observed_at":"2026-08-06T22:36:41.369605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:36:41.438405Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.438405Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:022d917de5ccee4b838a27469f7f9a5cff0aeab71c924df911db2442041417dd","observation_id":"9725d029-a434-408e-b4f7-1a3a251fada7","resolution":{"observed_at":"2026-08-06T22:36:41.438405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T22:36:41.685574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.685574Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:5d31f1196ff45e7dd5af35bcb2a888c1f39b65c4a5487a806fb40de2a7501d28","observation_id":"c030d5ff-4f4e-4a31-95cd-2127a6cf995a","resolution":{"observed_at":"2026-08-06T22:36:41.685574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:48.193454Z","title":null,"venue":null,"work_id":"44c16310-a005-4cd3-ba3c-be9fcc038cbe","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.826052Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:bd8ba9a7b39c82b5368933f8a598ceb4fdc5abe05fea39c2c7414820f1e04afe","observation_id":"69c1f3e3-825d-45de-a713-bd71074f7788","resolution":{"observed_at":"2026-08-06T22:36:48.332392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-07T14:06:07.358887Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19683","snapshot_observed_at":"2026-08-06T22:36:41.978125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.978125Z"},"links":{"cited_paper":"/paper/2505.19683","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:cc2bfec69e0f81996723355b4c43d5d3d9fb0e59b17b8bd346ebcdcd0da2f8f3","observation_id":"17a169ef-baee-4141-a20b-587776fef169","resolution":{"observed_at":"2026-08-06T22:36:41.978125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-05T18:32:49.850038Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-06T22:36:42.146724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.146724Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:d499da9c595d6de0e6b96bc95ffdd3ff158854bf33df5407d7aa5356ea8d160a","observation_id":"cfbb0d56-e472-4344-ab30-6a7a09779e7c","resolution":{"observed_at":"2026-08-06T22:36:42.146724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-05T06:15:27.387414Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-06T22:36:42.313802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.313802Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:05b31320d173311f51135e8d12a3f17bdcc4de7206bbcb0902f23505576045ac","observation_id":"2d722460-63ac-4ef0-bdcd-672c1891413e","resolution":{"observed_at":"2026-08-06T22:36:42.313802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-05T08:43:12.035234Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-06T22:36:42.406234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.406234Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:9022906432b03c8dd8d3f32b0e78d77310cbe9d5b58a314f27e2796261ce1c11","observation_id":"8b15e6fa-9b30-40d4-8df5-08b7af498f81","resolution":{"observed_at":"2026-08-06T22:36:42.406234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.870320Z","title":null,"venue":null,"work_id":"e97defa5-14e8-4471-852f-06ad60cdec85","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.497421Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:30a9ef824785a0fbb5e5a711e2f6d9f1e436ae36ce92172019f617843d2ad9e5","observation_id":"bdb8f448-6613-409d-8391-bf6d51358543","resolution":{"observed_at":"2026-08-06T22:36:48.031390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T22:36:42.561879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.561879Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:79b1b1315a1c1610c2d41efdb451aee8508f46549540a0adeac7b00a40c8cbfb","observation_id":"40593145-71eb-4183-9f85-5f38e66d7558","resolution":{"observed_at":"2026-08-06T22:36:42.561879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.636518Z","title":null,"venue":null,"work_id":"65785f98-3ce4-49e1-a24e-71926d488a76","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.625120Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:e6e0e37c33abaa6471a871ec3dffd21a206f5a4d5fccb1d4680825b28eb05337","observation_id":"e650d70f-b58b-4084-ab85-5bdf84073b81","resolution":{"observed_at":"2026-08-06T22:36:47.726733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.420661Z","title":null,"venue":null,"work_id":"0855ecc3-6890-4c83-92ca-21544bc5ab2d","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.687111Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:2d8f0959f941705c8ed36177b7e7de8d8dad22e6f71c93dc1eb5325dfa19a292","observation_id":"c4f224b8-47a4-4c60-867b-e6dd639c5596","resolution":{"observed_at":"2026-08-06T22:36:47.536393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:36:42.774037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.774037Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:dff325069a1fb0aaa9c30cc5557abf7f964a6e9c18292363ea4982816a26bac4","observation_id":"d349826a-2549-4668-ab70-27a71dc6a5f6","resolution":{"observed_at":"2026-08-06T22:36:42.774037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.224735Z","title":null,"venue":null,"work_id":"3d982375-9d4c-4fa9-9feb-5e896b956cb9","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.844408Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:4469aab3d8ceca4ddbd30f47a27ee2439f36e0eb1aafbe47f9416a0b91784ee9","observation_id":"12488757-e78c-4a47-bf9a-8b41e6bbb716","resolution":{"observed_at":"2026-08-06T22:36:47.296199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-08-06T22:36:42.927894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.927894Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:407b39b14152fa6cae26add1fbab42f4e05e45cf41387bab8f6ed82ae12ba946","observation_id":"af810d31-6b93-466a-aae4-81e72e25c7fa","resolution":{"observed_at":"2026-08-06T22:36:42.927894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:36:43.013554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.013554Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:9ca610966deb949e43c92618a9af02101971a880971f9582f31a075b527f5957","observation_id":"11592a68-2150-4cfa-9ff9-147ac89d1dbf","resolution":{"observed_at":"2026-08-06T22:36:43.013554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13746","last_updated":"2024-12-18T11:28:05Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T11:28:05Z","title":"RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13746","snapshot_observed_at":"2026-08-06T22:36:43.134536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.134536Z"},"links":{"cited_paper":"/paper/2412.13746","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:018cfbc00fa9234633890a90c03651d35de82d5e453560402e0dfd4ce66cb65f","observation_id":"563cd57d-4319-48dc-a29a-5bdf892a5138","resolution":{"observed_at":"2026-08-06T22:36:43.134536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-06T22:36:43.222340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.222340Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:52c74dc806e9037409b2d54f57c1b73ffd90f5ff2aa1dca39cdbee53e3215e16","observation_id":"55131c7c-5202-4653-8ad2-711d937d028a","resolution":{"observed_at":"2026-08-06T22:36:43.222340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.283968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.283968Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:6332ed4b25296e990004477f1fd820b82995bac97920df353e20469f144047a5","observation_id":"168d3974-78aa-4789-8369-2f46f9d735fc","resolution":{"observed_at":"2026-08-06T22:36:43.283968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.360429Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.360429Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:33a56cbbd329abbd11d609340b01e78ee035c144237210e6eaaeb09ac40086cc","observation_id":"2d3bb893-9a25-4e4d-848c-60ef6b79823b","resolution":{"observed_at":"2026-08-06T22:36:43.360429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:36:43.438047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.438047Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:a96d692937fd1d00ad3faee5cf36d49fcb5aa08279f3c3740f1ef3abaa976eca","observation_id":"6c9e2b1f-c263-474e-aa11-0fce5b7db5a9","resolution":{"observed_at":"2026-08-06T22:36:43.438047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-06T22:36:43.531337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.531337Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:7dbae714409ec84e66bc148165a5df0cd6b84e9061b9409ff3902a8de969f4f3","observation_id":"c4bef8c0-b8c5-474b-8a7d-b23863924a88","resolution":{"observed_at":"2026-08-06T22:36:43.531337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-05T10:59:28.485092Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02584","snapshot_observed_at":"2026-08-06T22:36:43.620059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.620059Z"},"links":{"cited_paper":"/paper/2502.02584","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:ea4b7f10db3f2623ef24ab84541ffbaa0a0e19ce62081fd60c909f5dd240c1eb","observation_id":"2c681772-ba8e-4653-83e6-f73694c759db","resolution":{"observed_at":"2026-08-06T22:36:43.620059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16033","last_updated":"2024-06-23T06:54:47Z","snapshot_observed_at":"2026-07-06T18:35:35.687129Z","submitted_at":"2024-06-23T06:54:47Z","title":"Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16033","snapshot_observed_at":"2026-08-06T22:36:43.709254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.709254Z"},"links":{"cited_paper":"/paper/2406.16033","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:82309299e460210caa8fb12bdab4814a2fcfe98cdbe20ac6ef92386f4b9bdea4","observation_id":"027d2cb7-8b0b-4b7a-a572-cc99be388e3e","resolution":{"observed_at":"2026-08-06T22:36:43.709254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-06T02:13:58.479161Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04447","snapshot_observed_at":"2026-08-06T22:36:43.779856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.779856Z"},"links":{"cited_paper":"/paper/2412.04447","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:6a7ec700eb78f59fd00c90f2381f0e8eb38271ee8629bb47b6e9fd06400be158","observation_id":"0cb8f075-81df-44af-a819-b23870384605","resolution":{"observed_at":"2026-08-06T22:36:43.779856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-06T22:36:43.891326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.891326Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:22c09edb55ee68e16b9f413fbab751aca2d5b6f1293e11b9c3a03d4fcabae02b","observation_id":"36cc2361-8787-4bb2-b086-cdebe9bba711","resolution":{"observed_at":"2026-08-06T22:36:43.891326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-07-06T17:39:32.800594Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T22:36:43.969795Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.969795Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:2bfcd47af9d34f998c57186aaa2a72a19d5350b4e1fe03ee3e0c1ee34652ee9d","observation_id":"de0dac99-505e-4fda-9f2a-d93267561f42","resolution":{"observed_at":"2026-08-06T22:36:43.969795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19723","last_updated":"2025-06-27T08:25:48Z","snapshot_observed_at":"2026-07-06T20:13:45.123960Z","submitted_at":"2024-12-27T16:21:58Z","title":"OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19723","snapshot_observed_at":"2026-08-06T22:36:44.079391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.079391Z"},"links":{"cited_paper":"/paper/2412.19723","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:a578b1dca48c34a3e2c24224c45b2496985968a629dca4a83744a19cff0706df","observation_id":"3dc86184-7470-46bd-ae30-9af0b0e30b48","resolution":{"observed_at":"2026-08-06T22:36:44.079391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:44.193779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.193779Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:917535db52a50a036f1a3aedeba703a4d218be20a12b2013ec2dfb7e246f7b98","observation_id":"3bd24895-869d-4623-ae1a-74c79815fa6f","resolution":{"observed_at":"2026-08-06T22:36:44.193779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:36:44.304809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.304809Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:b1dd8b5960c52acf672dcab66c3548bc9ca846ef7a6eaae79e0e26ea407de1bf","observation_id":"eaf61ff5-95e3-42b3-8bb5-622ab65d8b6c","resolution":{"observed_at":"2026-08-06T22:36:44.304809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-06T22:36:44.366489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.366489Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:93dbb0a4d2f0ad99d4399aa2d190000a89d62285fb1ffc49a39870bf032fab04","observation_id":"c46d6f02-f238-456e-8f5c-127d2a1518c0","resolution":{"observed_at":"2026-08-06T22:36:44.366489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:44.432191Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.432191Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:f04d0878d2e77803f7ea900c34a6fdff9e4944aa9af9d083e70419e4e941d432","observation_id":"9bd1a4cf-3b2f-4787-ad6c-73ff556a3023","resolution":{"observed_at":"2026-08-06T22:36:44.432191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01863","last_updated":"2024-07-02T00:24:01Z","snapshot_observed_at":"2026-08-06T20:08:58.356364Z","submitted_at":"2024-07-02T00:24:01Z","title":"VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01863","snapshot_observed_at":"2026-08-06T22:36:44.501851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.501851Z"},"links":{"cited_paper":"/paper/2407.01863","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:bf231473c718a3a80b29f01c64da56d02ed01e85cde15550e1f05006fe71e398","observation_id":"97b2a971-9d40-41bc-86c7-83e970d60b63","resolution":{"observed_at":"2026-08-06T22:36:44.501851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-03T17:10:32.264100Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-08-06T22:36:44.505963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.505963Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:b36d4d771ece3879a3fc7793eabcdd87cda86446c9c61e5dc7321c89a296239a","observation_id":"8e0486c0-ab10-4aaf-a464-eb7c2fc8e9d9","resolution":{"observed_at":"2026-08-06T22:36:44.505963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T22:36:44.585127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.585127Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:ce07524962c97e1aa4533b6626dc6d7b48643106d1703018b09be00a44a49371","observation_id":"eac92648-2a35-4996-8114-fa90e82c1a78","resolution":{"observed_at":"2026-08-06T22:36:44.585127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.972885Z","title":null,"venue":null,"work_id":"40097a72-cb7a-429d-b347-56d8a6b68432","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.721148Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:ff143c1725fbac0ae2ceb47cc94eee5b9c8070c26ae5165396b82ffb697f355c","observation_id":"a412a3c8-72dc-466b-9fde-208523838d65","resolution":{"observed_at":"2026-08-06T22:36:47.087466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.775751Z","title":null,"venue":null,"work_id":"3be33692-1d1a-4355-a4e8-59a1fd257880","year":2020},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.901469Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:359b0cd07126b023e524ef0679f735ece8d98884ca15f6af7206e1915590a36b","observation_id":"5d209ea6-adfe-47c5-bf66-a0419f304ee3","resolution":{"observed_at":"2026-08-06T22:36:46.860630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-07-06T16:35:40.224690Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-06T22:36:45.082095Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.082095Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:82368b28c9cebd098b1a1db0ad92cbfea26405d0e15434d98535db41ee4a7281","observation_id":"7f309774-b59f-4f7f-be72-d7885afdbca8","resolution":{"observed_at":"2026-08-06T22:36:45.082095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-03T17:57:06.981080Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-06T22:36:45.285843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.285843Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:4611209bbea4695e8d36ece96a0561b065c0aa15d0f9b4dffece81870bde8655","observation_id":"72928ad8-48a3-482c-9f98-3429532b762e","resolution":{"observed_at":"2026-08-06T22:36:45.285843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05047","last_updated":"2024-10-07T14:05:05Z","snapshot_observed_at":"2026-07-06T18:42:22.322763Z","submitted_at":"2024-07-06T11:07:18Z","title":"MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05047","snapshot_observed_at":"2026-08-06T22:36:45.463037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.463037Z"},"links":{"cited_paper":"/paper/2407.05047","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:60b17cda62d4cb0eb5234e297cf93150c579b9b42b36a4bb81ed702662171d0e","observation_id":"b81944de-802d-48d4-8d7c-31505eeed8c7","resolution":{"observed_at":"2026-08-06T22:36:45.463037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02391","last_updated":"2025-05-24T16:15:46Z","snapshot_observed_at":"2026-08-07T12:38:35.693216Z","submitted_at":"2024-11-04T18:56:42Z","title":"Attacking Vision-Language Computer Agents via Pop-ups","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02391","snapshot_observed_at":"2026-08-06T22:36:45.668547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.668547Z"},"links":{"cited_paper":"/paper/2411.02391","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:c6102a378a8d250a9808eb41b30cc8d2792886d439dff53503a8d024443b333a","observation_id":"8a5f0f52-67b2-4554-a6b8-26260ebf08cb","resolution":{"observed_at":"2026-08-06T22:36:45.668547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15978","last_updated":"2024-08-28T17:49:29Z","snapshot_observed_at":"2026-08-06T06:30:12.135984Z","submitted_at":"2024-08-28T17:49:29Z","title":"WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15978","snapshot_observed_at":"2026-08-06T22:36:45.814121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.814121Z"},"links":{"cited_paper":"/paper/2408.15978","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:1977a703a85b5978ba3cd8b92a0befa07518ac665188f2c12b4ccf493288d02c","observation_id":"9f1ab5c3-d448-454f-9bf4-2ccd1f9dac4a","resolution":{"observed_at":"2026-08-06T22:36:45.814121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-06T04:09:56.184787Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-06T22:36:45.894072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.894072Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:44973b110f0fb64db1f4b63e3fb3bacbf80a8a63efd39eb4daabfb39a36a97ad","observation_id":"be8ff1ed-8400-433b-aa1e-e13b8a79b760","resolution":{"observed_at":"2026-08-06T22:36:45.894072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-06T22:36:45.933900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.933900Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:41b19e4ae3a081ff442988ab5efa1b7d6c023ee2e7c1fb04da317c9ad86bdb4c","observation_id":"59d6978a-d62d-4dbf-9edc-cd76423a9675","resolution":{"observed_at":"2026-08-06T22:36:45.933900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-06T22:36:45.975203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.975203Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:e997a2cfd0fa477d2edf4270b7e92d3cce800568a1edcea73df5617eb694d680","observation_id":"83c0accd-e77a-4a31-b5f9-5fa06e6e5ad1","resolution":{"observed_at":"2026-08-06T22:36:45.975203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.052241Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:46.052241Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:5137928110767e76b3429b9fb26b41bffd2c87fa7b74dbc90afca4db6c4c075c","observation_id":"3493dd4f-8f64-4b55-97a7-1aaf7321bd13","resolution":{"observed_at":"2026-08-06T22:36:46.052241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.166368Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:46.166368Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:1948e9ef5c8386165f93a0a83a589c814a12c882b9a79111c112d156990120ec","observation_id":"b1d9ba60-f5b1-496e-bbd3-e045859f0fc6","resolution":{"observed_at":"2026-08-06T22:36:46.166368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:39:14.206067Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.21252."}