{"as_of":"2026-08-12T20:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:731817f767def4d1f8d18813f5e8e5d37b01fc7d6e4bce460b9394419a031b46","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:51:51.527625Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:16:44.541597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T01:37:30.528844Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":"2512.03438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-07-03T01:37:30.528844Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","venue":"cs.AI","work_id":"bde9d3ec-3c0c-4774-9595-0c4d38ad2730","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-11T03:30:51.869417Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:ed8056c9afb09e35d36b5a34c63baf3235f92337abc2b5dfe9f38b7225ce0ab5","observation_id":"056266b2-5ce0-43dc-9a29-c00e181962ce","resolution":{"observed_at":"2026-05-10T14:00:28.762336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":"2512.03438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-07-03T01:37:30.528844Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","venue":"cs.AI","work_id":"bde9d3ec-3c0c-4774-9595-0c4d38ad2730","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:1b92c0aa5e1d41cf5778ecd59a40e920efd25f8d34affa88acfce0da71ae6919","observation_id":"05dd8d5a-264b-4ebf-a384-e86bce466c59","resolution":{"observed_at":"2026-06-30T18:55:00.226075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":"2512.03438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-07-03T01:37:30.528844Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","venue":"cs.AI","work_id":"bde9d3ec-3c0c-4774-9595-0c4d38ad2730","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:eee5308b5c972848bc23f5f656ffa27502286fbb26a48b68e6fecbe37c0cefbb","observation_id":"b86aef18-4663-47d9-952f-b024056ced4f","resolution":{"observed_at":"2026-07-03T01:37:30.530160Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-08-01T01:16:44.541597Z","title":"arXiv preprint arXiv:2512.03438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-06T22:52:32.781663Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.541597Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:645534bb87fb0bd6946c90ae3e9dbd9edd0baa775d405323fd242270ccd6a5ac","observation_id":"258d5d9b-27fe-4947-ae63-2174fdc12742","resolution":{"observed_at":"2026-08-01T01:16:44.541597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.03438/citation-record","integrity":"/paper/2512.03438/integrity","json":"/paper/2512.03438/citation-record.json","paper":"/paper/2512.03438"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:41.814971Z","title":"Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:41.814971Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:555b5b5e686165a26f7a76f2c685776bbe7ad9291f3e1364ec90a09c6195933e","observation_id":"b1cf2288-fb57-4cc0-ade0-561e6fae198f","resolution":{"observed_at":"2026-08-03T18:51:41.814971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T18:51:41.863940Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:41.863940Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:e458884fa0ea1577a229c840d57fa32a726e26d58524970d22a59d0414ceae8f","observation_id":"b6691b1a-3c08-4130-ac42-9ea98a651408","resolution":{"observed_at":"2026-08-03T18:51:41.863940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09481","last_updated":"2024-11-19T16:55:55Z","snapshot_observed_at":"2026-08-07T03:30:45.524834Z","submitted_at":"2022-02-19T00:30:52Z","title":"TransDreamer: Reinforcement Learning with Transformer World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09481","snapshot_observed_at":"2026-08-03T18:51:41.949829Z","title":"Transdreamer: Reinforcement learning with transformer world models.arXiv preprint arXiv:2202.09481, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:41.949829Z"},"links":{"cited_paper":"/paper/2202.09481","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:be336f3696557369b5982cd7068963ddf88e6fca9d2d95aa170abe3b08179208","observation_id":"a31de791-e45c-45f8-8294-2f91e5923d7e","resolution":{"observed_at":"2026-08-03T18:51:41.949829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.039837Z","title":"Train- ing strategies for efficient embodied reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.039837Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:50c7f3db7e35ea88ea05594ceb3a81483ad31d6affd3bd061a0c3cffe0f02e19","observation_id":"d9a87b94-e835-4154-aec5-210c4525180e","resolution":{"observed_at":"2026-08-03T18:51:42.039837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.137544Z","title":"Vision-language models provide promptable representations for reinforcement learning.Transactions on Machine Learn- ing Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.137544Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:f2ad982c0d54f5fb616c042114e84a88cf9d0787bb71638395014ef9a7d62397","observation_id":"fa07bc4f-f08a-407a-818f-923bbe67742e","resolution":{"observed_at":"2026-08-03T18:51:42.137544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.237400Z","title":"Scaling instruction- finetuned language models.Journal of Machine Learning Research, 25(70):1–53, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.237400Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:0aece87af135d42dee7eb1573ce8d06642f93b528bb8b8ec7834db22dda42ac8","observation_id":"bfc72d3c-103a-4f5a-a2fc-30c662f43eae","resolution":{"observed_at":"2026-08-03T18:51:42.237400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.346027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.346027Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:6a91b776c14f8fa86c6e12fb1e14f75de508fdc0bf7b0099462d3bb8d674f726","observation_id":"c9418be7-cc7f-4ccb-a5c8-c188ce4f8d8d","resolution":{"observed_at":"2026-08-03T18:51:42.346027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.409109Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.409109Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:0a9d8019f4c89d28705c164f1705da6bfcc0412b804dd80314656b9206e820cc","observation_id":"b657edd2-03da-41c1-ab5a-6cd12e73d80d","resolution":{"observed_at":"2026-08-03T18:51:42.409109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.503617Z","title":"Tool-lmm: A large multi-modal model for tool agent learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.503617Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:73b4fae835576c1f1af442e8b29bda37d33c87e134eea66477b7754fd7b9d984","observation_id":"7db0bd1d-abd4-475a-9833-be98c51d2dab","resolution":{"observed_at":"2026-08-03T18:51:42.503617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.579935Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.579935Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:996385db7501ea10979aeb4cd3d4f2d296f044b0ec4cc4022d2fa8c83f73c307","observation_id":"14490dd9-9557-4a00-a348-c48c74f2db82","resolution":{"observed_at":"2026-08-03T18:51:42.579935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:42.629359Z","title":"Agent ai: Surveying the horizons of multimodal interaction.CoRR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.629359Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:59597f4b2b127c067aaec10fb108180689df1a7d0dbb60b59592cb000347874b","observation_id":"966708de-edc7-413b-b3d8-bf06890198eb","resolution":{"observed_at":"2026-08-03T18:51:42.629359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-08-12T14:09:31.044610Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-08-03T18:51:42.710473Z","title":"Grit: Teaching mllms to think with images.arXiv preprint arXiv:2505.15879, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.710473Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2fdc4d4e7b00d7efc765123d52a183f45b2a7f41cfd4dca1eeb1b6686f41d748","observation_id":"cad19910-7fe8-4123-a681-b87d362055f9","resolution":{"observed_at":"2026-08-03T18:51:42.710473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-03T18:51:42.838254Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:42.838254Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:33732f987771a035850e42c95629184bcc13b3c380e2b6b7b928ebaac69c072f","observation_id":"59a66006-ca95-4f28-9e78-e8c6cb5aa430","resolution":{"observed_at":"2026-08-03T18:51:42.838254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.003439Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.003439Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:6782c8e6e580ee38cc0f66fbe7c9a76a96fe924a66ba07fccf2c60a1f2932fb5","observation_id":"bafa6645-251d-49da-98a0-e45c78ed0176","resolution":{"observed_at":"2026-08-03T18:51:43.003439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.114191Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.114191Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2e639f74421eddf42ec4f0e7e58cab8e0725693d6ccba19f2e685f0bc425e13f","observation_id":"94b94af4-a048-4138-ae21-7b35f0abdf27","resolution":{"observed_at":"2026-08-03T18:51:43.114191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.246845Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.246845Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:4b3ed92d79895bb2e2463245616594c2ff25e9482c63a529613c825c94b26b32","observation_id":"8f509be3-c5fd-4a73-9e5b-ef5ee4edcf1c","resolution":{"observed_at":"2026-08-03T18:51:43.246845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T18:51:43.340881Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.340881Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:666faf5a47ca8eec4921e03947dfd52a765b35a2b42d3212f1260614f9cbc8f9","observation_id":"6927bdf5-b849-496f-9d59-03d25dde7db5","resolution":{"observed_at":"2026-08-03T18:51:43.340881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.451963Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.451963Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:f7e0cbda960e553da3713c15271d2aefc93f775f85d883259059bda55522efb4","observation_id":"a408dd7b-1330-4754-8ccd-22f5fc8703b1","resolution":{"observed_at":"2026-08-03T18:51:43.451963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-03T18:51:43.577972Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.577972Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:e953bb4bfd8553cb61ab66e42eb1c710b2fba0c24ee0145acd26546682977d1c","observation_id":"0b8c1652-67e6-4256-9196-2368481fab8e","resolution":{"observed_at":"2026-08-03T18:51:43.577972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24527","snapshot_observed_at":"2026-08-03T18:51:43.701009Z","title":"Train- ing agents inside of scalable world models.arXiv preprint arXiv:2509.24527, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.701009Z"},"links":{"cited_paper":"/paper/2509.24527","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:f89640691488ff1ba32fb4720cb6a5d9b00125bd590f98a054383f0fc8a2c402","observation_id":"06f649a4-7afc-4633-8d0d-6e96de609fe4","resolution":{"observed_at":"2026-08-03T18:51:43.701009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.791670Z","title":"Ghil-glue: Hierarchical control with filtered sub- goal images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.791670Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:c65f73dbe1e9fa6d29db6d9336852cc0f08beadf2933eb930a5406134732ba3a","observation_id":"e88bb92c-2667-4108-9e58-cb22783dbc26","resolution":{"observed_at":"2026-08-03T18:51:43.791670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.887743Z","title":"Breaking the reasoning barrier a survey on llm complex reasoning through the lens of self-evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.887743Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:5a55852d0ee40b249f580d1121987a710ac02fa62776a6954561fedf39063703","observation_id":"ba529d4e-97b9-4e75-8b2a-8f6b9b26d030","resolution":{"observed_at":"2026-08-03T18:51:43.887743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:43.979744Z","title":"Glm-4.1 v-thinking: Towards versatile multi- modal reasoning with scalable reinforcement learning.arXiv e-prints, pages arXiv–2507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:43.979744Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:0e2277449ba5ad443e664767f8745f3490c6bcd421304cbd1be214e32f2bd01e","observation_id":"4c097d75-dfa5-421b-b6c5-c497715cd5b5","resolution":{"observed_at":"2026-08-03T18:51:43.979744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.131430Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36:31096–31116,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.131430Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b6f541ab0935b8e0e1e03f9b98813c7aad3416b7f598a1f859f5f6157ab705e0","observation_id":"ffa928b4-c1f2-4302-9eb4-8fb33326c27a","resolution":{"observed_at":"2026-08-03T18:51:44.131430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.320900Z","title":"Visual language maps for robot navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.320900Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:11ec2af8509a58f3b8818194681588db9ae04cb27953d2423be0539419ee2a3c","observation_id":"646e10c6-43fc-4eef-9e30-6f6d25d15c7e","resolution":{"observed_at":"2026-08-03T18:51:44.320900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.428998Z","title":"Multimodal spatial language maps for robot navi- gation and manipulation.International Journal of Robotics Research (IJRR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.428998Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2179d800b36fbabfabf586991db9d0310eb476b91436be66cdccf08dda987ee6","observation_id":"05f55d8d-52ec-499b-9aa8-d814f3fc2811","resolution":{"observed_at":"2026-08-03T18:51:44.428998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-03T18:51:44.540761Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models.arXiv preprint arXiv:2307.05973, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.540761Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b931c68d5ab0ef274625c98226a16391885fca2a50bfc93327c1ced068a6e3ce","observation_id":"2b0f6080-163b-4528-902a-66b104e49156","resolution":{"observed_at":"2026-08-03T18:51:44.540761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.654518Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision.arXiv preprint, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.654518Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:42e9db776b172903be90028e0e6215ef29ece026766f468965b2d73225a4c409","observation_id":"5f818a9d-a60a-48ce-8154-b2c83884673b","resolution":{"observed_at":"2026-08-03T18:51:44.654518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.716678Z","title":"Beyond sight: Fine- tuning generalist robot policies with heterogeneous sensors via language grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.716678Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:65b3165fbca9ef73be1c80d12dc861cf08d7cdf66719e989ebd0041e588531c0","observation_id":"c0ebbc32-2467-409c-acc9-d6f6275e9052","resolution":{"observed_at":"2026-08-03T18:51:44.716678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:44.792965Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.792965Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d971c5d3865c83b169c867090bce0b4fcee535978bbb696f602bf4cfe401d936","observation_id":"fab59234-3c16-4559-98fa-5b2ebc2fdbd0","resolution":{"observed_at":"2026-08-03T18:51:44.792965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18358","last_updated":"2024-05-28T16:55:41Z","snapshot_observed_at":"2026-08-03T17:33:50.716704Z","submitted_at":"2024-05-28T16:55:41Z","title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18358","snapshot_observed_at":"2026-08-03T18:51:44.900908Z","title":"Mmctagent: Multi-modal critical thinking agent framework for complex visual reasoning.arXiv preprint arXiv:2405.18358, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:44.900908Z"},"links":{"cited_paper":"/paper/2405.18358","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:32684b4bc128c9190a2ea9f1e145c0bbeadbebbae0a41afcb5ca325196d7c95a","observation_id":"bf5ac4f1-f029-44f9-a35d-dd53891240f8","resolution":{"observed_at":"2026-08-03T18:51:44.900908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:45.019738Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.019738Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b06d8b63b109c6098660b97c8d9f88b6c438224e94d5a6217a4baa79dabf8184","observation_id":"97ce085a-80b7-48bf-85aa-9cf22d158860","resolution":{"observed_at":"2026-08-03T18:51:45.019738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:45.133168Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.133168Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:51c965f146fc0e9bb4fbbe636ee5d802c736847a93a6db5d70fbd9245f45528f","observation_id":"4703619f-16c7-4e4e-b1f0-51fd9cb3fff2","resolution":{"observed_at":"2026-08-03T18:51:45.133168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-07T15:49:03.741523Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-03T18:51:45.298957Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.298957Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2fbdf6573f75c72c693aa88d5dd4d9e92a87716b24d61a6859e537d0e5bc162f","observation_id":"ec5d3588-2cf9-4939-b169-9d4cc35722ef","resolution":{"observed_at":"2026-08-03T18:51:45.298957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:45.353774Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.353774Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:815b494d64a7bd81b068953ed14005043d56eb30dc323e7bfb9454ce0918097f","observation_id":"e9dd06be-0ac6-4558-8fe0-bfafba9c6e65","resolution":{"observed_at":"2026-08-03T18:51:45.353774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-03T18:51:45.408449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.408449Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:e979906d0913605661f2ba9cc0bf07821aa39fb3c8e5f740576e9a3cd94afa3b","observation_id":"7a88e144-876e-4915-9400-e565ea15a902","resolution":{"observed_at":"2026-08-03T18:51:45.408449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:45.518711Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.518711Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ccc15f15c624e43e4fd71341953afc2987d2f607c539af406136c6123b8601ea","observation_id":"ee7337f9-87a1-430d-8405-e2ab8aabfd36","resolution":{"observed_at":"2026-08-03T18:51:45.518711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:45.664347Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.664347Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:f064e338b974f92618d109954d3a3afe4452ea9e08c2048b46f9f6c21139d9b4","observation_id":"bbc43b82-a66d-4a22-94a2-eda8e21733c2","resolution":{"observed_at":"2026-08-03T18:51:45.664347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-03T18:51:45.837086Z","title":"Gui-r1: A generalist r1-style vision- language action model for gui agents.arXiv preprint arXiv:2504.10458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.837086Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:823aec99f164f7f5b0540dc01e5a6301dbe3a952b6fa237ff487f0289301598e","observation_id":"cc92eca6-c13c-45d7-ae70-a3c2b94a34a4","resolution":{"observed_at":"2026-08-03T18:51:45.837086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.012568Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manipu- lation tasks.IEEE Robotics and Automation Letters (RA-L), 7(3):7327–7334, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.012568Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:1aff948c9b551e392eefaf8d8d542052c2c8524a5955f5c2519752e176e878e9","observation_id":"27d9199d-ba19-48e9-9704-b2c670d8c5e4","resolution":{"observed_at":"2026-08-03T18:51:46.012568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.125999Z","title":"Grounding language with visual affordances over unstruc- tured data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.125999Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b893929b7407cad95d39b6f24fd85dbafe90e8434717fd9a66c46344cb9a1d92","observation_id":"6a0df662-3761-469a-b3d2-d42a28cd4a77","resolution":{"observed_at":"2026-08-03T18:51:46.125999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.262136Z","title":"Policy adaptation via language op- timization: Decomposing tasks for few-shot imitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.262136Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:99e54a44762e0b782d1d09ad6da1d4e503104ad5ee081fa613054eae8b5d2636","observation_id":"93eb17f9-fa90-43ca-a291-44e6cb3b8ed0","resolution":{"observed_at":"2026-08-03T18:51:46.262136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.346290Z","title":"Steering your generalists: Improving robotic foun- dation models via value guidance.Conference on Robot Learning (CoRL), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.346290Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:8b004232d5ddaaaf2e0336f5a42ebf9312e78ecbc1496c488e0a4c25f87ecdf3","observation_id":"c15984cd-bd6b-4c46-83b8-223a1998eba0","resolution":{"observed_at":"2026-08-03T18:51:46.346290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-03T18:51:46.394825Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.394825Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:af1a08c7608d77737bbb3ee372cba1e811c348d40b4c5ee5f02f92c0b6b3a71a","observation_id":"34ac3fed-8674-4559-b95c-8d965880314d","resolution":{"observed_at":"2026-08-03T18:51:46.394825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.517463Z","title":"Generative agents: Interactive simulacra of human behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.517463Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:3f406463c114d76ec7630d7a02b7b57336b95b88aee1dc768b922fefda826962","observation_id":"0bfe305b-8c9a-4a59-815f-643496dd1596","resolution":{"observed_at":"2026-08-03T18:51:46.517463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.638786Z","title":"Fast: Efficient action tokenization for vision- language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.638786Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:f0269dc71ad616e5e7a03598c7e4ec8989aab8505a5d2c06dfcd9ed3aca09dde","observation_id":"27454999-db97-47c2-b26c-6c5e042b97ed","resolution":{"observed_at":"2026-08-03T18:51:46.638786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.727873Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.727873Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:8d7161759fee4fd1a00dbf274fd4a0dab4675c49896fa80cc1df84a4c6c04013","observation_id":"f359e17f-95ec-409a-b452-504201331a10","resolution":{"observed_at":"2026-08-03T18:51:46.727873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.767211Z","title":"Real-world humanoid locomotion with reinforcement learning.Science Robotics, 9(89):eadi9579, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.767211Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b291ce193c0fd4fb0fbec15a3cbd17276d10ae6b90d2b23878f3c64e825af02d","observation_id":"20e86bb1-b537-4db4-af9f-3b80378def10","resolution":{"observed_at":"2026-08-03T18:51:46.767211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:46.941419Z","title":"Latent plans for task ag- nostic offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:46.941419Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:c14ca2e77b27bee8dc07f8c53f7e55bd6c4842808519dd5a9419173d3ed81f2d","observation_id":"27eee35f-1de0-4458-ba4b-437bffa5ecc5","resolution":{"observed_at":"2026-08-03T18:51:46.941419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.019376Z","title":"Toolformer: Lan- guage models can teach themselves to use tools.Advances in Neural Information Processing Systems, 36:68539–68551,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.019376Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:37b4c9d74ac1a36f1fd79858af1c2467ed12f7ac3bba67c1a6615c41400ab530","observation_id":"5795de7c-42bb-4675-851b-bab24139991f","resolution":{"observed_at":"2026-08-03T18:51:47.019376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.099422Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.099422Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d6f18bff391e928c9dcc51fa42083e14e441b33bd5f6e8af3934cf330fe2b700","observation_id":"2d3625bb-42ab-4e3d-ada3-808ed8820a40","resolution":{"observed_at":"2026-08-03T18:51:47.099422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T18:51:47.152960Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.152960Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2c2b9fbbbbfbbf22a1e830d643ca1a14a70aa91383f018c41f7e7b4be879911d","observation_id":"9d94507e-de9d-42d2-8dee-7d3d51f2cc71","resolution":{"observed_at":"2026-08-03T18:51:47.152960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-03T18:51:47.201232Z","title":"Hybridflow: A flexible and efficient rlhf frame- work.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.201232Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d16a1db5984b2bbf6ae0cf6d2ee26f09f80d763b4a7cd151e7541320534643e0","observation_id":"ba02a353-00bc-4803-a3f7-8d3c3bab322a","resolution":{"observed_at":"2026-08-03T18:51:47.201232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.302493Z","title":"Koala: Key frame-conditioned long video-llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.302493Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2625db734cfbd73b821d2d2231486992368aae3a8dcfd0b77beb9f61f2de8b0c","observation_id":"3fc048df-a88e-4bce-91d2-e3307ef8f3c0","resolution":{"observed_at":"2026-08-03T18:51:47.302493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T18:51:47.364014Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.364014Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ec2037b9a69e6465b811aa67c7a974b3e028d054c81af46170acb3a9c0f15cad","observation_id":"366d7f97-a531-4eea-8862-d05cbf46d5bc","resolution":{"observed_at":"2026-08-03T18:51:47.364014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.427553Z","title":"Cambrian-1: A fully open, vision-centric explo- ration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.427553Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:63e8caa7f5469d08d08dffaa0d66c3829a0d9a0cc7853441870a7106bccb078b","observation_id":"88043d61-01f7-41b1-b149-a43c58a44a95","resolution":{"observed_at":"2026-08-03T18:51:47.427553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-03T18:51:47.534125Z","title":"Self-instruct: Aligning language models with self-generated instructions.arXiv preprint arXiv:2212.10560, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.534125Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:6780150288e541f3c69fbba74b3da98660acc08a5f02bae2cd6bdf2fd0dd34ef","observation_id":"d29d8af5-e775-48c2-bf6f-88a781b12b0a","resolution":{"observed_at":"2026-08-03T18:51:47.534125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.642128Z","title":"Genartist: Multimodal llm as an agent for unified image gen- eration and editing.Advances in Neural Information Pro- cessing Systems, 37:128374–128395, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.642128Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d48be3762ccd73a176420b077175acc1db10ca58a285854c13ac5f4ebae0373c","observation_id":"3b5ae711-0391-4605-b1d1-dcfdfbf72183","resolution":{"observed_at":"2026-08-03T18:51:47.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.769021Z","title":"Blip-3: A family of open large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.769021Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ec6d0cc06a92a51aa8b733f012f75859afcc37058e8db462bc2ae1aa029e2368","observation_id":"a68b1fc0-afd0-46c9-b561-3ad287ac16d7","resolution":{"observed_at":"2026-08-03T18:51:47.769021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:47.888856Z","title":"Magma: A foundation model for multi- modal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.888856Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:21fd7b8b79a6c702dea5f39748f82f4dc5e9c224e39684965b6a1b35a5503bde","observation_id":"4b885699-3a4d-4a5d-97e9-929a88efa11e","resolution":{"observed_at":"2026-08-03T18:51:47.888856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T18:51:48.033515Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.033515Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2b62a532f8c6875323cf0986297a3721fda261b9fc38d58c0981b15fedc6551e","observation_id":"f552b55e-3a86-4cb2-9843-7e8bfaf3efeb","resolution":{"observed_at":"2026-08-03T18:51:48.033515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:48.192562Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.192562Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b2587e4b93144416132395404bfd4b528db7c19de487263f81f33e2927163231","observation_id":"c6a3b328-4a7c-40f1-bbbd-828095bf693c","resolution":{"observed_at":"2026-08-03T18:51:48.192562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:48.308180Z","title":"React: Synergizing rea- soning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.308180Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b75a6d6e216ff4ed7a44fcbae2b5c549f7108dd65dad53acb1fe74544763210a","observation_id":"4c1e20f1-45fb-463f-851b-1ef2bff7fd45","resolution":{"observed_at":"2026-08-03T18:51:48.308180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-03T18:51:48.397328Z","title":"mplug-owl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.397328Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:a0757ab038996afefaccffeb34d3340fb8669881d41ebb18c29a5efe62d861e6","observation_id":"92116bc7-0121-4aed-a4df-7aac4060b207","resolution":{"observed_at":"2026-08-03T18:51:48.397328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:48.519217Z","title":"Spatial mental modeling from limited views","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.519217Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d9192f1892c7b476ef3088e389ffb855e6769df054a3bd59720e1f8920dd147f","observation_id":"ee0aa102-1432-428b-825a-6292d3d7afdb","resolution":{"observed_at":"2026-08-03T18:51:48.519217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-03T18:51:48.676604Z","title":"Mmt-bench: A comprehensive multimodal bench- mark for evaluating large vision-language models towards multitask agi.arXiv preprint arXiv:2404.16006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.676604Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:6ef8bdd15717bf4f8eef532c5abe1f922967646951c5f181f2b2681ee466ac1e","observation_id":"e9f9dc04-1acd-416f-ac6a-8f94a592e8ba","resolution":{"observed_at":"2026-08-03T18:51:48.676604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T18:51:48.859923Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.859923Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ae9f1e47cc865a67c12bcd9c938fecfa1e16f62042e617e121b6b1e8f655c2ca","observation_id":"4cad96f5-ebc5-461c-a586-3ed7ba30fb45","resolution":{"observed_at":"2026-08-03T18:51:48.859923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:48.997415Z","title":"Robotic control via em- bodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.997415Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:c6857eb8012828f769289c2c18650bcced32a4935ba1624849c94ccc3d76b07e","observation_id":"df1568e0-223a-4b38-a150-4f7ffec200b8","resolution":{"observed_at":"2026-08-03T18:51:48.997415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-03T18:51:49.136696Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.136696Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:e9d2495b77184a5903c984e1f5d870c5ad9c3b23d8f4771609318de28a8a89b8","observation_id":"00327093-cbe3-4fe3-ade1-5fb576ca8d62","resolution":{"observed_at":"2026-08-03T18:51:49.136696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13254","last_updated":"2024-06-12T17:59:55Z","snapshot_observed_at":"2026-08-12T14:09:32.120043Z","submitted_at":"2024-02-20T18:59:55Z","title":"CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13254","snapshot_observed_at":"2026-08-03T18:51:49.249079Z","title":"Countercurate: Enhancing physical and semantic visio- linguistic compositional reasoning via counterfactual exam- ples.arXiv preprint arXiv:2402.13254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.249079Z"},"links":{"cited_paper":"/paper/2402.13254","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:bba57e6a88b20f6b74b77dc70dfc68db56e3bf8c15a10b06fe4d2909a540d9b8","observation_id":"246cfcd9-23e8-49f7-ae4b-bc94a50fb253","resolution":{"observed_at":"2026-08-03T18:51:49.249079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-03T18:51:49.421484Z","title":"Multimodal chain-of- thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.421484Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:39dfce8137736eb2580791d97e7581d574856362f9d892692fd49002fc2b7053","observation_id":"ad87133e-003b-4ec7-921c-3fec66bddc16","resolution":{"observed_at":"2026-08-03T18:51:49.421484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:49.530353Z","title":"Pareto optimal learning for estimating large language model errors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.530353Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:32ee1ce584d65eaecc60f2e02b9cfb1f63a5b760eca5dc933156a9d3046a2807","observation_id":"59c822db-bcc1-4fc2-bd42-65e226d834ca","resolution":{"observed_at":"2026-08-03T18:51:49.530353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-03T18:51:49.614162Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.614162Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:290efd86a98e27d06746de0efbfd3265bc5fcea4329223a55946681341d933d2","observation_id":"2bd8d282-6f11-4455-b966-7dfe799193c2","resolution":{"observed_at":"2026-08-03T18:51:49.614162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-03T18:51:49.672073Z","title":"Least-to-most prompting enables complex reasoning in large language models.arXiv preprint arXiv:2205.10625, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.672073Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:9cf364ea55afec0f8a5bc8f55f9874368720c11c2fc88e1a2498784d61171238","observation_id":"9fc2116e-7316-4876-b6f8-bacbbf998553","resolution":{"observed_at":"2026-08-03T18:51:49.672073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-03T18:51:49.723535Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.723535Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:7dcad6493dd700a67e983ec676a26522a2dfa26d684a4cbb0e7393a60294f675","observation_id":"14138785-c689-4ebb-b641-52723afdabed","resolution":{"observed_at":"2026-08-03T18:51:49.723535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:49.796853Z","title":"Around”, “Among","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.796853Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ac35d2aa6d30cdd43b685a4a81801c3ff33697365a2faeaa9acc9bbce64accd6","observation_id":"51270dc4-ba9b-4d15-a1eb-cd30ff187329","resolution":{"observed_at":"2026-08-03T18:51:49.796853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:49.958206Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.958206Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2b8df3515fed3dff532cc7f25f92b34fce321db5b1e180af53ebea9186f42dc5","observation_id":"153f8c65-9b49-4f3f-80c5-eb866fc8a884","resolution":{"observed_at":"2026-08-03T18:51:49.958206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.045829Z","title":"seedling with roots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.045829Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b36b55f272e64f8eb1f978f565386d6b3487815fa6ee1e28b29bd6286f151c87","observation_id":"bd4f989b-8000-4259-8364-87a665419929","resolution":{"observed_at":"2026-08-03T18:51:50.045829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.129764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.129764Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ca93e2202ea8cbaf1b7c5b10a062bd92a18252f71dfb457ef56ab5deebe386ce","observation_id":"419d895a-0abf-43ef-a213-09d0f72fcfd9","resolution":{"observed_at":"2026-08-03T18:51:50.129764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.215470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.215470Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:45b1e509b5bcc098d361f049dcd000c7c5df214492f785bbcd452dac7ce52bf9","observation_id":"f5abf25e-874a-42e7-babe-a9caea7b2c21","resolution":{"observed_at":"2026-08-03T18:51:50.215470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.274770Z","title":"roots”, “leaves","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.274770Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:181e54b436c1d5289823700f072d8cedf8e2f4253dfadca704248a46cdfacc9e","observation_id":"a0d5d264-79cf-4c2a-aba5-55defbadb592","resolution":{"observed_at":"2026-08-03T18:51:50.274770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.404241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.404241Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:976094eb5fc3b6d9463cbb1a8e53e89786f801f08804b3f51984919ef28b759f","observation_id":"c6c5bc54-bf96-428a-ab7d-c4bfa536e35c","resolution":{"observed_at":"2026-08-03T18:51:50.404241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.550354Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.550354Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b18d2e5735aabb5ce73cb514ca5dcac6c57426a8ac408c5603af51c16a1dc327","observation_id":"f190bb95-80d9-4add-84ae-6fccf9ee6395","resolution":{"observed_at":"2026-08-03T18:51:50.550354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.664403Z","title":"observations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.664403Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:ffaa84339e86c04e4e45620ff33603ab5c70b8e25c0d95ae0aa2d1c52082cff5","observation_id":"987f1d23-4f28-4176-a156-461d3db54ff4","resolution":{"observed_at":"2026-08-03T18:51:50.664403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.802486Z","title":"anchor_text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.802486Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:7e438e1622a49391b16b7b0efdd8cea7e39bfc5c3661e65839fc0919c772fd2c","observation_id":"a9e79421-4b8c-445f-8bd7-929e5eacb754","resolution":{"observed_at":"2026-08-03T18:51:50.802486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:50.961345Z","title":"anchor_text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:50.961345Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:bd72caff7108edca316c65ce82bee4c85f0951a0a3767d64356a7fd83027fdfe","observation_id":"7b18387c-e59c-4500-a00c-19effc0567bd","resolution":{"observed_at":"2026-08-03T18:51:50.961345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:51.124122Z","title":"anchor_text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:51.124122Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:7f0bbb7be66343de1bc7e7be722f7070ac06274290c9e49c38d9fa2ce4c8af79","observation_id":"e13dee2c-26e0-4a9f-a029-5361ba534362","resolution":{"observed_at":"2026-08-03T18:51:51.124122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:51.264324Z","title":"frame\": the nearest explicitly stated single frame number (case-insensitive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:51.264324Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:2b4d7471323201571659b6454eca7c27ac0e8ae0c94658b2407047b81c965f5c","observation_id":"55a34ff7-19a3-4b1f-bb07-3a454b591014","resolution":{"observed_at":"2026-08-03T18:51:51.264324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:51.401535Z","title":"frame 6”) and/or a SINGLE time (e.g., “4.47 seconds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:51.401535Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:b13dd1f9d5ddda059d2343f38dc2ebb2eb097637f7c4368324f74d3d9c2c83bf","observation_id":"60d51d6c-2b70-4969-a895-674698c3220d","resolution":{"observed_at":"2026-08-03T18:51:51.401535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:51:51.527625Z","title":"frames 1–6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:51.527625Z"},"links":{"citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:123a0b7f08121b8d43022eded68248addd60e41bf5821986c52094ea377ba32b","observation_id":"4e90fe34-1b6d-4f2e-bfc2-2f00f278d650","resolution":{"observed_at":"2026-08-03T18:51:51.527625Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 4 inbound Pith citation observations for arXiv:2512.03438."}