{"as_of":"2026-08-05T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5aca836040b18d212118bfda802fa6c35e036be4bfba735aebebee5562a39bd0","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:56:35.246936Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T11:53:35.315405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T12:03:24.478700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"cited_work":{"arxiv_id":"2603.00546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.00546","snapshot_observed_at":"2026-07-16T02:22:33.558625Z","title":"Advancing multimodal judge models through a capability-oriented benchmark and mcts-driven data generation.arXiv preprint arXiv:2603.00546, 2026","venue":null,"work_id":"279b0ff6-2205-489f-8eb4-e3efee67c674","year":2026},"citing_paper":{"arxiv_id":"2605.28579","last_updated":"2026-06-04T01:52:56Z","snapshot_observed_at":"2026-08-02T10:57:19.143783Z","submitted_at":"2026-05-27T15:01:59Z","title":"MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T11:53:35.315405Z"},"links":{"cited_paper":"/paper/2603.00546","citing_paper":"/paper/2605.28579"},"observation_digest":"sha256:ba079d16bc327e1077978fb3f132799130b2d22bb411c75fa299cd5c4ef2d25d","observation_id":"ffe76620-05ea-44fc-a9dd-555a06543955","resolution":{"observed_at":"2026-07-16T02:22:33.558625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.00546/citation-record","integrity":"/paper/2603.00546/integrity","json":"/paper/2603.00546/citation-record.json","paper":"/paper/2603.00546"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T19:56:27.636015Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.636015Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b0e24a3d7f596700c2e27b0b1759fb6321b3e82dbbb7b09717ce49baeb836e96","observation_id":"b95ece5a-b998-493a-afb4-1960e4c6ae80","resolution":{"observed_at":"2026-08-02T19:56:27.636015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.702214Z","title":"MLLM-as-a-judge: Assessing multimodal LLM-as-a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.702214Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:cb8ea498591e3c12cb9f2a24e63882f5a5361d2bc5ac8ac76bc93cc1d9e9918b","observation_id":"ba55f520-b18f-42e9-a081-06f8bc823306","resolution":{"observed_at":"2026-08-02T19:56:27.702214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.862650Z","title":"Are we on the right way for eval- uating large vision-language models? InAdvances in Neural Information Processing Systems, pages 27056–27087","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.862650Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:641883b03eba5ab7937e819789f5e153e3654afa3ef9d538d0885c3529353082","observation_id":"8fcd1560-87f6-4f87-900e-1b0d3c5986c8","resolution":{"observed_at":"2026-08-02T19:56:27.862650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.933953Z","title":"M 3CoT: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.933953Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:9c9e5b36350c17e05586b86205293349219a3e36bb80e86b2b683ee7f65a5b13","observation_id":"ef5384c5-836c-40fe-8259-79616f60e36b","resolution":{"observed_at":"2026-08-02T19:56:27.933953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17793","last_updated":"2025-03-22T15:00:18Z","snapshot_observed_at":"2026-07-06T20:57:07.848926Z","submitted_at":"2025-03-22T15:00:18Z","title":"Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17793","snapshot_observed_at":"2026-08-02T19:56:27.990155Z","title":"Every Sample Matters: Leveraging Mixture-of-Experts and High- Quality Data for Efficient and Accurate Code LLM, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.990155Z"},"links":{"cited_paper":"/paper/2503.17793","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ba464c7213f5128b4ead71af65dcc26a67507bc84cfc17cee8a7608a196c6b18","observation_id":"84d50ffe-005a-44d1-9271-ab0a73a543e3","resolution":{"observed_at":"2026-08-02T19:56:27.990155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T19:56:28.086458Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.086458Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2a524bf75812c82be6f36d4144680fb7be473fb8cfcc861962fd4177dd660b3e","observation_id":"0941feac-e08e-45b6-a2d3-e47d321952a4","resolution":{"observed_at":"2026-08-02T19:56:28.086458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.281455Z","title":"Efficient selectivity and backup operators in monte-carlo tree search","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.281455Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:764d07588780a18f5bb06e53e9b93a96cd54855bfb8bd0a326481f336acd68cc","observation_id":"0cd671ac-3da1-430b-83e5-ca62c916d4f5","resolution":{"observed_at":"2026-08-02T19:56:28.281455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.333590Z","title":"Mm-ifengine: Towards multimodal instruction following","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.333590Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:81bccf6910283bde980f7bdd163fc9159ef0ceecdb0220e4ceac1113132ab5fa","observation_id":"2bb1915a-a348-4929-842a-7dd66ba6281e","resolution":{"observed_at":"2026-08-02T19:56:28.333590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13427","last_updated":"2025-06-05T05:29:41Z","snapshot_observed_at":"2026-08-03T07:51:34.363947Z","submitted_at":"2025-05-19T17:55:08Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13427","snapshot_observed_at":"2026-08-02T19:56:28.466278Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scal- able Step-Level Supervision, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.466278Z"},"links":{"cited_paper":"/paper/2505.13427","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:3de68ce4cb2382da8642dd6f5f746c2a288cfc6f1f0a30b1707f3336db1db131","observation_id":"1ca2f837-1ad3-464c-977a-95820fb8ab4f","resolution":{"observed_at":"2026-08-02T19:56:28.466278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T19:56:28.590628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.590628Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e850ccf476a89a906cce57d69450356d6d3322e0c2b719b00c5833e406d62fb4","observation_id":"335b71fd-9a91-4702-bd6d-6032358880bd","resolution":{"observed_at":"2026-08-02T19:56:28.590628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T19:56:28.712586Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.712586Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:feb997547aff1b3b96f112f90c8dc50606932e2e8b0965b33321e1bddcd567c5","observation_id":"1d0c79e5-8689-4bae-998d-69272bda73bc","resolution":{"observed_at":"2026-08-02T19:56:28.712586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.870577Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.870577Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e2252b9e5af9be1dcffec8cddb973597eba92d28cd9a6c3e82e051873984b415","observation_id":"39b7f9c5-7f9a-4158-9cc7-c8e0108ca516","resolution":{"observed_at":"2026-08-02T19:56:28.870577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T19:56:29.025781Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.025781Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:7abaa27f3e90bcdff00557e869410b9104c09985683b61c1a974fd24968b2da7","observation_id":"3aee8528-579a-4fed-8205-11dc1dea540c","resolution":{"observed_at":"2026-08-02T19:56:29.025781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.234607Z","title":"From generation to judgment: Op- portunities and challenges of LLM-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.234607Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ae6f1462755230ababd087d5ce764caeabe5dc2fae2178af2213f7ae571eb59a","observation_id":"87760e01-565b-4123-b07d-57f1790e7454","resolution":{"observed_at":"2026-08-02T19:56:29.234607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.459785Z","title":"Vl- rewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.459785Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f5877b3c3c0ca03593e2801454feb4bb1636f3ecc0c89cb7610ea85f107315cd","observation_id":"71cc89be-fb92-444b-aeaf-a86bf525ddd8","resolution":{"observed_at":"2026-08-02T19:56:29.459785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-02T19:56:29.545585Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.545585Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:bd6c892d8d7599d2c7363b177404703a6e06c95e79696d3e23acafd92296e099","observation_id":"7ee98173-9fc8-4dbf-8b53-fa26734bad75","resolution":{"observed_at":"2026-08-02T19:56:29.545585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.603365Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.603365Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:459cb5752a4314e6260bce7b6b56ed405f9aa5b58df85b17e17916380b84ae5b","observation_id":"58616d15-a35e-4aaf-a966-0a5b2c48cabd","resolution":{"observed_at":"2026-08-02T19:56:29.603365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.695853Z","title":"MIA-DPO: Multi-image augmented di- rect preference optimization for large vision-language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.695853Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c329720d8780861dfdda887ff778bb3dad6d0d2f94f6c2ea15e5734ebf138bc1","observation_id":"6a18d149-1aea-4896-837c-e464ed7cdb4a","resolution":{"observed_at":"2026-08-02T19:56:29.695853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-02T19:56:29.797926Z","title":"Improve Mathemat- ical Reasoning in Language Models by Automated Process Supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.797926Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:310cf71cdc42aea43b956e2f2a3f2e643817fa4f3d07eb5de94ca2d61dbb95f5","observation_id":"208fa9a9-3acd-4f28-8dec-c003cd5ceac1","resolution":{"observed_at":"2026-08-02T19:56:29.797926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.895022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.895022Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a3b4b175509490560eb65f336797b1a33f592187fbc9ebfb3378e675be70e064","observation_id":"f61d1d53-b576-40ce-9acb-973822cea5b2","resolution":{"observed_at":"2026-08-02T19:56:29.895022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.102690Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.102690Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:4b6808fa5cab797a2bd5a3452f2f3513ca4838c773c26ef7925106b9134aed9a","observation_id":"2d4e6dec-6a8a-418e-8d02-bb3c703b7692","resolution":{"observed_at":"2026-08-02T19:56:30.102690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-02T19:56:30.300126Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.300126Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:32e5abb2b06c3799ddc8c3d60b70d0580a4217764043579258d424b0d6126bc7","observation_id":"c12b52a3-8990-4b27-9ced-1a516fc9929e","resolution":{"observed_at":"2026-08-02T19:56:30.300126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.487065Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.487065Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f68768d0000ad6a81361826b20ce6920016f592a590e3f9623f17e9e23e6651d","observation_id":"43515f9f-132e-49c3-b733-22885f3f06ae","resolution":{"observed_at":"2026-08-02T19:56:30.487065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-03T18:18:56.117009Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T19:56:30.621170Z","title":"MiMo-VL Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.621170Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c403bbb7506dc66a2db9e0792552ff5e0474579f96d1dbc9108a5640000c3177","observation_id":"9a820de4-a910-4a8d-a76c-6440165bd6fd","resolution":{"observed_at":"2026-08-02T19:56:30.621170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.762220Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.762220Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:aabb5be1e23426ce84d2892406ba16f2f7be94fd8bc0eea0524390b897ad6eaf","observation_id":"0d27393f-7520-41ec-b445-bf42ce9cb706","resolution":{"observed_at":"2026-08-02T19:56:30.762220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-07-06T18:57:05.603342Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-02T19:56:30.964243Z","title":"Self- taught evaluators.arXiv preprint arXiv:2408.02666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.964243Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ace4ae10e51c2f9b873b6c655baf7f5788797792cf1d8316fd0dea047a0a7a6e","observation_id":"c956993e-8033-4bb3-b88b-75403199d96d","resolution":{"observed_at":"2026-08-02T19:56:30.964243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-02T19:56:31.100419Z","title":"Enhancing the Rea- soning Ability of Multimodal Large Language Models via Mixed Preference Optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.100419Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0f83609d9e725e47240d07e0fa250b3c88323ea5ba1d41d537161e1e0b28a2c5","observation_id":"a626effc-9642-4931-824b-5e833831e6c4","resolution":{"observed_at":"2026-08-02T19:56:31.100419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T19:56:31.186279Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.186279Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:51ccbc2713e280e2ae06775873a17416e91b371864bd1bd352d72318296f8a1e","observation_id":"ce050607-bab2-4464-920e-7d6e9f9d0c97","resolution":{"observed_at":"2026-08-02T19:56:31.186279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.281051Z","title":"SoTA with less: MCTS-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.281051Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:897fc45926448394f6487f50ddb6ffa5f56d738a481dd6f283f83a4a175b00a3","observation_id":"c2f28a64-5501-45db-9814-687086437bd8","resolution":{"observed_at":"2026-08-02T19:56:31.281051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.484261Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine- tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.484261Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ce9c059be079c1d6a611e66e577a90f549a1ac9b806a899144b2d436b4548954","observation_id":"ad8e691b-00d2-4218-b3d7-c3be76064525","resolution":{"observed_at":"2026-08-02T19:56:31.484261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-02T19:56:31.618718Z","title":"Unified Reward Model for Multimodal Understand- ing and Generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.618718Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b15961c2fdfe35cb3c8c3db0da274ebb8ce88454a270e37177332a2239f13001","observation_id":"31c2c557-fc52-4cda-b980-d82f73e7fe6d","resolution":{"observed_at":"2026-08-02T19:56:31.618718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.796208Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.796208Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a78f5fdd3c80647c148a1b095a40f6db79b70601ae4ad9b904efeb749060d7fd","observation_id":"b91f6f3c-613a-4879-8461-3f7d70e5a749","resolution":{"observed_at":"2026-08-02T19:56:31.796208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.858453Z","title":"J1: Incentiviz- ing thinking in llm-as-a-judge via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.858453Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:6e0c18e47334ca766cdc01f94c076bb569a94f3a5cac885ec8b0f6cdb8234106","observation_id":"aa3fc127-7b93-4a47-adbb-472fafd0fd03","resolution":{"observed_at":"2026-08-02T19:56:31.858453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.956457Z","title":"Multimodal Preference Data Synthetic Alignment with Re- ward Model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.956457Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b1a46ceb2b8d12ac08b762b5baf49b9aade42cef89d43b3cec0832b4847966ef","observation_id":"9bd999c1-d447-4212-867a-446d82d60593","resolution":{"observed_at":"2026-08-02T19:56:31.956457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.055970Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.055970Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:1773c6d25445e6fa38c51d0e76f2a4d7f59730d44edce08633e99d962ea52fa9","observation_id":"0e781a24-5391-49b4-8b7b-e7aaef3e4f5f","resolution":{"observed_at":"2026-08-02T19:56:32.055970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.196304Z","title":"Monte carlo tree search boosts reasoning via iterative prefer- ence learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.196304Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:aeea417c30ba62646104191df91b7732107980c704cd913df97acc2e451c7daf","observation_id":"4663dc23-d0e0-44b4-9820-d6eee7906aa3","resolution":{"observed_at":"2026-08-02T19:56:32.196304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.330762Z","title":"Llava- critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.330762Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c09369873a3a3893bf9c1fe98bb0d4e8f21719ac82a4d148e7d814c64df803a3","observation_id":"b5119312-8e6d-43c8-b357-5e3047303c21","resolution":{"observed_at":"2026-08-02T19:56:32.330762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.399862Z","title":"Chen, Wenzheng Liu, Wei Zhang, Wenjie Zeng, Xikun Zhang, Jingyi Zhang, YuXin Song, Wenhao Wu, and Dacheng Tao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.399862Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0d28e90259705d53b0f46d23ce158d92c45dfbfaace495975f0168fdb1f8d3ed","observation_id":"344db1ac-eb17-4a89-9d55-ceccdefb5236","resolution":{"observed_at":"2026-08-02T19:56:32.399862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.469544Z","title":"Mulberry: Em- powering MLLM with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.469544Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0cb40c90a5e0806967ebb435d5db4ca2afca0bfee0b2a39575c85b35eef70442","observation_id":"fd9a0d36-c308-4e71-96c4-c1ac633e6e16","resolution":{"observed_at":"2026-08-02T19:56:32.469544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-07-06T20:39:33.620222Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-02T19:56:32.626573Z","title":"Multimodal RewardBench: Holistic Evalua- tion of Reward Models for Vision Language Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.626573Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:8e02df314412fae99ddce703db3d5ec6e14f3ab9aef7e4298905260d9790d17a","observation_id":"9f2c75f4-4926-474b-a789-d457d18ac3e6","resolution":{"observed_at":"2026-08-02T19:56:32.626573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.755599Z","title":"A survey on multimodal large language models.National Science Review, 11(12): nwae403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.755599Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b364b41ba1af6f1d70c9bc2be55d84e34edc66a2ccf79580036e493b7cbeef16","observation_id":"3cf4578e-7a22-4c43-abf0-b9ca285ac19e","resolution":{"observed_at":"2026-08-02T19:56:32.755599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T19:56:32.882052Z","title":"DAPO: An Open-Source LLM Reinforcement Learn- ing System at Scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.882052Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:84157f737b3023b1528f5b72b4c9f62ea90e270822f53b9755752cebc1d52891","observation_id":"d11f5705-9a13-488c-a8c2-2f9dd3c1a2e3","resolution":{"observed_at":"2026-08-02T19:56:32.882052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.951359Z","title":"Rlaif-v: Open-source ai feed- back leads to super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.951359Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:809863c429e9cc238ae287a4d3bd18c0d1e1751d9248a90953c79f401c0cbd71","observation_id":"9c4fd817-26f6-4cc6-b80e-2a2cb135ec94","resolution":{"observed_at":"2026-08-02T19:56:32.951359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.005768Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.005768Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:19f1b9875fed45b755c267e72fd9b9276a9566ab4d316a992821f29a32dfd89f","observation_id":"155dead4-f115-4b73-9b19-9b1e359ebcef","resolution":{"observed_at":"2026-08-02T19:56:33.005768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.062176Z","title":"MMMU-pro: A more robust multi-discipline multi- modal understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.062176Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:d93d676d2005a15e78a4bfc2950815785ef501cc0f06da5e2d230e6597240f1e","observation_id":"4a90b085-ec11-4f09-8888-9cca6fa2976b","resolution":{"observed_at":"2026-08-02T19:56:33.062176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.095853Z","title":"InternLM-XComposer2.5-reward: A simple yet effective multi-modal reward model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.095853Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:7d3b1675f8fd6d265a29d017fabe7e50096719f196c3929672548469c5c320b0","observation_id":"03d601ef-cc7b-48f2-bd53-025463245bb5","resolution":{"observed_at":"2026-08-02T19:56:33.095853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.160515Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InComputer Vision – ECCV 2024, pages 169–186, Cham, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.160515Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:873867b139abc5b3cabf9ce1a1e30973f62db06c5b2b4dc054107878ef3c6d1e","observation_id":"b478a422-45dc-47ad-adaf-8b3ec038477c","resolution":{"observed_at":"2026-08-02T19:56:33.160515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-02T05:59:18.612817Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-02T19:56:33.229753Z","title":"Gpt-4v (ision) as a general- ist evaluator for vision-language tasks.arXiv preprint arXiv:2311.01361, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.229753Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b813f32d8b6de2495336294dc0633e1cf29c47c295d9ba9174621e560708471c","observation_id":"e328df1f-2149-4c82-8992-e059970c3bd9","resolution":{"observed_at":"2026-08-02T19:56:33.229753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-05T02:34:33.557081Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:56:33.297932Z","title":"R1-Reward: Train- ing Multimodal Reward Model Through Stable Reinforce- ment Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.297932Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:51efeae5628e84cb87379b4b25bb6bb383396f6ba81cec1420460b116e35b2c4","observation_id":"0e55930e-bd20-4101-a527-91a1f656848d","resolution":{"observed_at":"2026-08-02T19:56:33.297932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.389349Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.389349Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f7729ee98838916b1e834b10311c37ae430757973ccbacddd7402314358b5119","observation_id":"e46844e7-e775-4c67-9b1d-6f524c4336b3","resolution":{"observed_at":"2026-08-02T19:56:33.389349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.492213Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.492213Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:3f1256f5f78476e02db05e23142d757099aaeb7086847f2cb094b19bd0cedd97","observation_id":"0634c388-8415-4f9c-bcc1-e76a24a1cd03","resolution":{"observed_at":"2026-08-02T19:56:33.492213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-02T19:56:33.552171Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.552171Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2198f675209c72fd7098c803bf2f4cdafa36dd4d8b931981d3f48c09aec2cba6","observation_id":"30b42ec6-0547-43d4-b6b9-6efe512f3a97","resolution":{"observed_at":"2026-08-02T19:56:33.552171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.610346Z","title":"Capability-Oriented Evaluation Framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.610346Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:4e46c1a00a5f1db950de02f01b5f504b6fd24a68244c77b0e3e44940189417b6","observation_id":"e10bb0df-8bd6-4365-93ea-d163e706ac3b","resolution":{"observed_at":"2026-08-02T19:56:33.610346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.646776Z","title":"Open-Source Training Data Collection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.646776Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:89973a964a9e028d43ba43dcdbe63f4edd38cd6ea463116651183f4dbc0b9b1a","observation_id":"b0bfeda5-4260-452d-9455-42e018e144f3","resolution":{"observed_at":"2026-08-02T19:56:33.646776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.698935Z","title":"Experimental Setup","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.698935Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c0c62ceee71d73a673e28822d021a8f8123971e7a39f009e59f9c072b21b5367","observation_id":"2569f6e2-ddd5-42d2-84e7-128362fddc86","resolution":{"observed_at":"2026-08-02T19:56:33.698935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.759584Z","title":"Benchmark Examples 3 A.1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.759584Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:1d077d5294bac9c187ed7cb6f96722f34855d5a2cc82cdb616a2b4d20b1e8b59","observation_id":"4a291b2e-12d8-4054-81af-e02c462b0813","resolution":{"observed_at":"2026-08-02T19:56:33.759584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.832523Z","title":"**Gross operating surplus**: Net operating surplus + Con- sumption of fixed capital = 240,000 + 110,000 = 350,000 Rm; 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.832523Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b4b21a82f7de74aaddd65a4f0a65cbd10af5976917f965731534e4c928d16c34","observation_id":"07341223-79eb-4b64-9143-15eec125faf3","resolution":{"observed_at":"2026-08-02T19:56:33.832523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.940890Z","title":"**Net operating surplus**: 240,000 Rm; 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.940890Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b4443d643eee2d63a2a87dcf5efa6743c71d237cfe89729ed5be27cb0d5f3afc","observation_id":"6284a8dd-0a6d-492e-a905-422ba40fa4c3","resolution":{"observed_at":"2026-08-02T19:56:33.940890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.012350Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.012350Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:6775e58f4c4a6e5951abb37f2d38d1311a6e4c4793718971bafe9b2fcf305406","observation_id":"362b74d5-ae8d-46c4-b058-ff5a35b0ea33","resolution":{"observed_at":"2026-08-02T19:56:34.012350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.045268Z","title":"**Sum of numbers in triangles: ** 4 + 11 + 18 = 33; **Sum of numbers in circles: ** 5 + 12 + 16 = 33","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.045268Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2cc03e3f1a367edc100da4ca071c60148003b53da8bfc01c9028377d1a84a939","observation_id":"8396c4eb-63c1-4346-b453-3922c691afe6","resolution":{"observed_at":"2026-08-02T19:56:34.045268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.111025Z","title":"We can apply this rule to the squares","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.111025Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:305f6b669d10a4855198bf9904da3c1e01b801cfa2f69b5173b47194954d60eb","observation_id":"6367bd4e-400b-41d6-98a2-0d8c14f1fc27","resolution":{"observed_at":"2026-08-02T19:56:34.111025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.142051Z","title":"Key Observations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.142051Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:bfaab803085cadb9a13b631d7132abe4d9ab7cedea1e33020cd11a8adfbe1215","observation_id":"1613519c-70a6-40cb-a12f-3594159d77c2","resolution":{"observed_at":"2026-08-02T19:56:34.142051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.206791Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.206791Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:bd8c21e9002bac08f8dd8e90a0c679d9325bc251a11059bc7db4bfb948c1d08b","observation_id":"473dd069-4e65-4f6c-ba93-10ee49400532","resolution":{"observed_at":"2026-08-02T19:56:34.206791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.244048Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.244048Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:9bada4dad8cf2351e5d6e07d8aac3e3b6f25bd62e039b6908e89af44a6cba43a","observation_id":"0bb5a77d-dc22-40ed-9233-9c4746f41ebf","resolution":{"observed_at":"2026-08-02T19:56:34.244048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.310999Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.310999Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:de9101d7f3e5288f794762888dd0395c5fa7dfaee0d471ef2dd067f5e99ddde0","observation_id":"a9e52dd4-6919-48a0-b722-62c693ff2d28","resolution":{"observed_at":"2026-08-02T19:56:34.310999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.371808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.371808Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:3885b29e40ab89209682b70ab4ee4aeb2185334723a50ff481eab200cadd0413","observation_id":"281b89df-2018-40eb-a9d5-47ae0071c3b3","resolution":{"observed_at":"2026-08-02T19:56:34.371808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.464640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.464640Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ca96683704979d6ee275a19dff48e1943e37f9155bc239c4460b7a47421af694","observation_id":"9f1f8935-3028-4716-b6cd-a0407b82339d","resolution":{"observed_at":"2026-08-02T19:56:34.464640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.535306Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.535306Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:df9006dc9287214eae6eac90bfef169db7d7636c5030d44bac9673dac564cf52","observation_id":"e5b0b1b4-e301-432c-b732-fe556ad5b261","resolution":{"observed_at":"2026-08-02T19:56:34.535306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.568170Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.568170Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:111d64d87d57d78d3c16587efc917b9e17526c14cfc4053648b2c99f6bc552fb","observation_id":"5745fa83-121b-4620-93c9-36b8e4490c53","resolution":{"observed_at":"2026-08-02T19:56:34.568170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.635972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.635972Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b4966dd02e9a8281b127a5b0000f0cef1272ad0a26b6eb622081a4aa786831b1","observation_id":"5fd8554f-5120-4673-a33d-06e2b89c8ab2","resolution":{"observed_at":"2026-08-02T19:56:34.635972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.745434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.745434Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:b58f8574176f37df93823b0ed1d5de4f45b6fb2462511aac9afa61d06d3106c9","observation_id":"1465f68a-7383-4e3c-819f-26928d009ee8","resolution":{"observed_at":"2026-08-02T19:56:34.745434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.814626Z","title":"Modify the given correct solution text by introducing subtle, hard-to-detect errors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.814626Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a183331a0ab3d6f19fe810e8b7a11f0a2bb012d91697a863cb8affac72d880cb","observation_id":"59d4d96f-b5a0-4ba1-bffc-3d8534be58a2","resolution":{"observed_at":"2026-08-02T19:56:34.814626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.951668Z","title":"Prioritize factual correctness above all other factors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.951668Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:587e8d4be61a4b9463ca87c5c609c73417a788e84dead9cfae7cc251d50d3946","observation_id":"9d0f57b1-70f9-4258-8890-eae572b8befa","resolution":{"observed_at":"2026-08-02T19:56:34.951668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.022760Z","title":"Identify any reasoning fallacies, invalid inferences, or irrelevant logic chains that might affect reliability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.022760Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:5f5f7d7eff04e7a3b3f754745971e0017693b68e855f860badec54599172585c","observation_id":"12fabe4f-29c8-4cc2-b9ec-245d1b9af5bd","resolution":{"observed_at":"2026-08-02T19:56:35.022760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.076387Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.076387Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:8f551c5dbd64a576f326636088908beecb36440bc4d06ab8632c835287708a31","observation_id":"2432c871-2dd6-4796-ac40-3f56498da1ea","resolution":{"observed_at":"2026-08-02T19:56:35.076387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.154932Z","title":"The response should neither omit essential reasoning nor over-elaborate with redundant or misleading content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.154932Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:36d10f7547eb3f39e9c2249e63c5330c864a1c3b6f62ea5ec4c57463350125bf","observation_id":"06447396-6fab-46ae-8381-46821f8fe1bd","resolution":{"observed_at":"2026-08-02T19:56:35.154932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.246936Z","title":"The decision should rely on reasoning quality, not stylistic fluency or writing pref- erence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.246936Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:517e4ef13a71a4ae9ebc84ef840cb0abc22d37704780cc752b143a73055160e4","observation_id":"386b1fba-a7de-4a2a-a35c-1eaf6c815f51","resolution":{"observed_at":"2026-08-02T19:56:35.246936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.346396Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.346396Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2067a8cbbd581fb7097e5e0986cdf60d7e10b62b8d274b9c9506d5c3cf701bcc","observation_id":"c91a1c5d-cc07-4537-81d6-5419be646f88","resolution":{"observed_at":"2026-08-02T19:56:29.346396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2603.00546."}