{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ed89ff13e9fee9cb50035dc86b2e855e569c2b2e81deb0b87a7347744494b03","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:29:58.706228Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T15:06:38.215137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:07:03.800004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:97eb8317f8727824c6aedd8af6c878707c3bb9442dce70fd3bf1b837fd045c47","observation_id":"42811ffa-b70c-4621-bfea-976bd4e8bfe9","resolution":{"observed_at":"2026-05-15T18:41:30.389824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:8f2cfb6091dc31a2528fed9e286f13534bfe73676ff209ad8b055cffe56c0d3d","observation_id":"bc77d68d-c518-4809-9aa7-c3db5c2fec50","resolution":{"observed_at":"2026-07-02T02:06:27.261864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2606.29758","last_updated":"2026-07-27T10:44:50Z","snapshot_observed_at":"2026-08-02T09:40:36.275703Z","submitted_at":"2026-06-29T04:04:32Z","title":"PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T07:36:39.835616Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2606.29758"},"observation_digest":"sha256:2c2f4e98ab9b050402a6dc091e56c9081cac664d3dc2f42cbd9a08924a94d209","observation_id":"a858a48e-99e8-4637-bbd6-e9b8dc097144","resolution":{"observed_at":"2026-06-30T08:04:29.016519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2607.00461","last_updated":"2026-07-01T05:29:02Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T05:29:02Z","title":"Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T15:06:38.215137Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2607.00461"},"observation_digest":"sha256:7ba765e8fc7bbe699d2c26a071e491cb498ea7bbb2460442ab2b3997496561eb","observation_id":"16209c2b-dcd3-46ce-befd-a980d05c49f3","resolution":{"observed_at":"2026-07-02T15:07:03.801892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21655/citation-record","integrity":"/paper/2506.21655/integrity","json":"/paper/2506.21655/citation-record.json","paper":"/paper/2506.21655"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.760588Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"0ef78ca5-1afc-49ed-a974-3f1ddaf19bb8","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.888597Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:e92ffe6401f2ee60f209f6e176668bf56bb797882829bcf16a986b3f4112f485","observation_id":"5c96e234-31ec-458c-8f5d-8bb24e67d18e","resolution":{"observed_at":"2026-08-06T22:29:59.781638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.703940Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":"705c5c9b-1f5f-4471-90a0-74349bd0b7a1","year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.904495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:54d7a23e27c36bcfa9cfe476aeab297cbe8e00bfeaed8f1e3ff5a3217b0e5a54","observation_id":"327722d8-5644-4639-9b27-3bed28a57ba1","resolution":{"observed_at":"2026-08-06T22:29:59.735122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.924914Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.924914Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:04cac03a0e9cb9502441e5362cc8a7e57be19f0808343455aebdbda4b1ca9f8e","observation_id":"d09779fb-616a-4f88-9d59-238be952b6ae","resolution":{"observed_at":"2026-08-06T22:29:27.924914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T22:29:27.932417Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.932417Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:97c2efcfbc7e4ded3f4ee3f5d5d9c3c88f5737e86f28fcf282d692591b89454d","observation_id":"e81456dd-7cec-4c91-9ef0-abfb61a3f24f","resolution":{"observed_at":"2026-08-06T22:29:27.932417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.636976Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"148134ec-a925-4d2c-92c5-165b9ea7d686","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.955233Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:8cddaaea054ca94d62d0844bd332cc84e2135a8ef405d40c08341be0b40fdb1d","observation_id":"016fa379-0fcf-4893-ad9f-fe665d6a571c","resolution":{"observed_at":"2026-08-06T22:29:59.652681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:29:27.974697Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.974697Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:c519f0b65c46681cee2697d4806cc9b22f71334efd3da2b50093943b16c1bae0","observation_id":"bbd749a9-6891-4608-86d9-ae3e8ea20915","resolution":{"observed_at":"2026-08-06T22:29:27.974697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-07T23:21:52.042305Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:29:27.988706Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.988706Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ce86a31c6c9da2083d1be5d8ecc4335d13967d17d60e90366ba585b4f5b2fe36","observation_id":"5fdd68c9-9932-4818-b4ee-3ff99ee3e845","resolution":{"observed_at":"2026-08-06T22:29:27.988706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.581917Z","title":"Polymath: A challenging multi-modal mathematical reasoning benchmark, 2024","venue":null,"work_id":"8e244c7b-ab52-4654-8582-17c38792cb46","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.994310Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:7fc8abe767d9086222e74e5d324b3b8d842d0513c5d99c5e95fa88c7d9966b28","observation_id":"e818cc55-f350-4991-8670-0a8a355a27a5","resolution":{"observed_at":"2026-08-06T22:29:59.614767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T22:29:28.009078Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.009078Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:1eaff6b1ad1d63ce8700a1070f23b13c085ec2865f4b10fb774bca1dafeadc46","observation_id":"dbc04aea-902b-41ec-8568-3dd0883b44c9","resolution":{"observed_at":"2026-08-06T22:29:28.009078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:29:28.028456Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.028456Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:b51b96b6e2fba7c06a26b1f9553c3508649b33d8075958b18b36913f7b9a63ab","observation_id":"80de8bee-487e-4ee6-9186-82df041b8cbc","resolution":{"observed_at":"2026-08-06T22:29:28.028456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.522828Z","title":"Figureqa: An annotated figure dataset for visual reasoning, 2018","venue":null,"work_id":"b9c351a3-e424-426e-addc-85510cae149a","year":2018},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.044738Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:7b29e0e3ecff459397f905afaf837a42579e20ed9cfb688ae3a697b390eaff3e","observation_id":"3ec7c38b-6828-4b97-88fc-9fa899b7ad1f","resolution":{"observed_at":"2026-08-06T22:29:59.544330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.463810Z","title":"Scemqa: A scientific college entrance level multimodal question answering benchmark, 2024","venue":null,"work_id":"4f67adde-b2ae-4755-9905-5f51e9265c65","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.050376Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:e3cc6f7538db5b96df432256d57bc5e8b9b961b4f3b80fb7a95b441a9b23c49b","observation_id":"acf61fb4-74fe-426d-b3ee-ff087bf9ce08","resolution":{"observed_at":"2026-08-06T22:29:59.480854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.407816Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning, 2022","venue":null,"work_id":"e8532c58-abc3-49e9-ad70-a7879906137c","year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.060256Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:20e54900326618f63fffc806f26e3bdc18fe02a60bb4e615a1bb685daa258a65","observation_id":"12dfd25f-c2a2-40f5-a76f-5eb6dfb29b1f","resolution":{"observed_at":"2026-08-06T22:29:59.429329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16081","last_updated":"2025-03-28T11:19:21Z","snapshot_observed_at":"2026-08-07T16:49:22.004428Z","submitted_at":"2025-03-20T12:22:18Z","title":"OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16081","snapshot_observed_at":"2026-08-06T22:29:28.079295Z","title":"Othink-mr1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.079295Z"},"links":{"cited_paper":"/paper/2503.16081","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:b1b889df718244d7fb822f05bb36d06f6b03ab3149bcc49c24ea315ed1669cf8","observation_id":"0f5e4e9e-3093-48d0-a5bb-64c12784dc1d","resolution":{"observed_at":"2026-08-06T22:29:28.079295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T22:29:28.095636Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.095636Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:496238694cb58d3877391448779bb4b0523b8c0d10f2798a6a5442125c5619cb","observation_id":"56df06e3-2475-4ddf-ad5e-8574e58b8645","resolution":{"observed_at":"2026-08-06T22:29:28.095636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.113236Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.113236Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:b051b94d3863296fc52fcd6f71418b5250e39e3a7a31bdb02ed422b8915a2417","observation_id":"206b3455-9ff0-4cf2-bd4a-da9688c92399","resolution":{"observed_at":"2026-08-06T22:29:28.113236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.132413Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.132413Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ef1fce07275f499acb260c7cb23b49b3bfdfcf45c07f3e950d4c9cce22d753d4","observation_id":"f3aac8ad-e753-4ebc-b15c-ffb64e941b4f","resolution":{"observed_at":"2026-08-06T22:29:28.132413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.347950Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning, 2023","venue":null,"work_id":"e170cd7b-ba3d-4ccb-a9a8-c99028899c45","year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.149495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:523c8a840cb56eda97ddb14287f83262271acd503a591371619048a1bba5dd85","observation_id":"03d23385-d3e8-4bdb-8bf6-8e49c2346561","resolution":{"observed_at":"2026-08-06T22:29:59.361633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:29:28.158314Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.158314Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:147e248e53f44cd7dd3a11cf1b425b615dbbe3b0abfc50af6cc13c606dff3bb0","observation_id":"71e362d7-4cd3-4a1f-a580-8f5c901f3d14","resolution":{"observed_at":"2026-08-06T22:29:28.158314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T22:29:28.186779Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.186779Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:25d4f63da8b96d2e7836db0c76996b5ca91196b8420cb2eb49a19bbb2a1e1ca0","observation_id":"f952b1c0-258f-48bb-aeb8-4b3a4d6ae0ca","resolution":{"observed_at":"2026-08-06T22:29:28.186779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.211930Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.211930Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:617fe0c075761020808d60c5aa98ecba1a55d0701c0ecbfb3247df606eb3ec2d","observation_id":"86fc2708-ff5b-4708-8c98-7bd8c78a9eb8","resolution":{"observed_at":"2026-08-06T22:29:28.211930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.226495Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.226495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:d095293056e2038d607432d6eef7f03abda63f90d204686c81a35ac4b52286c4","observation_id":"dc33ca82-101c-41c5-aaa3-3e8c96efbe77","resolution":{"observed_at":"2026-08-06T22:29:28.226495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.258630Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.258630Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:6837708602c5e9eb5a49dcaf27738e057d44648316215da97e3d583b3d1a119c","observation_id":"396e1984-423c-4197-943a-369eb298496f","resolution":{"observed_at":"2026-08-06T22:29:28.258630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-06T22:29:28.285695Z","title":"Skywork r1v: pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.285695Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:42f0a5184f93d9d91f6389406268039dc37382ff0fb2c6580a6be7e460fad72a","observation_id":"aa884deb-08a2-42ee-8cf7-3c4eb220165b","resolution":{"observed_at":"2026-08-06T22:29:28.285695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T22:29:28.314845Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.314845Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:55ef9a601731f569aee2553a73a6b84ab681fb3557ddc7d5915c180e240e3a9f","observation_id":"d3222508-3b10-4c05-9fcb-1cb1ca70d0b6","resolution":{"observed_at":"2026-08-06T22:29:28.314845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.253813Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning?, 2024","venue":null,"work_id":"4ea11da9-8c3c-4a7a-8d5f-1894232d68ea","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.332879Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:3593be3b7f4b4166eb4de2f4e21a538e5444e0bd8f432c91db0e0fea4d402c4b","observation_id":"9ebabd7b-508f-4a76-a38e-41f1264898a9","resolution":{"observed_at":"2026-08-06T22:29:59.270019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.350191Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.350191Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:0f8c6ee2bdfe8b45341fb4e4006ea312eb286c1b72cd3efcb1a17a23a441317b","observation_id":"39c9e3c3-3bf3-4f1f-a155-c8be6a65e26a","resolution":{"observed_at":"2026-08-06T22:29:28.350191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:29:28.369712Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.369712Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:f386fa018057f57ee31e977a5bd68667b9639457f61bc96dbb2a7ce38abfd264","observation_id":"28c8ddea-9165-4496-a0d0-ea487f9a260a","resolution":{"observed_at":"2026-08-06T22:29:28.369712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:29:28.391054Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.391054Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:30d032621cd988f2c0a78f30d37e4b1d070130d3b09186cc490e696d9a7f8eba","observation_id":"09744d3f-4f29-4648-8b1d-fa749b4b2543","resolution":{"observed_at":"2026-08-06T22:29:28.391054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.191839Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"8163cfb6-4f77-492e-8c06-e8f4a77c09a4","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.405993Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:7f9bb9d6fadbae3005bf31b321540300f2590bd6e979608b460967e48e2d8684","observation_id":"3fb3d1a6-01cd-4bbb-aa48-a8eb1b7bc719","resolution":{"observed_at":"2026-08-06T22:29:59.205422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.422267Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.422267Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ea174bc63d7994cdfaa42e4dbadbf24dd4ee770e8053e41c4a434d4be41ba391","observation_id":"df3d18f0-709c-4db1-a285-a23af471f3f5","resolution":{"observed_at":"2026-08-06T22:29:28.422267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T22:29:28.444374Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.444374Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:378e9b139a6e1dfc95f732338276a56b898576a8b3cf1d756dcd872fccfb6d3b","observation_id":"6696a32d-4608-4ef0-8de1-58e824fae9d1","resolution":{"observed_at":"2026-08-06T22:29:28.444374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-06T22:29:28.463737Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.463737Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ea54f03f8e989af596b23ceb76400c970f9aada02b11372c161b59510192d4ac","observation_id":"fe87a75a-7355-42d1-8540-f8e5d4d0c008","resolution":{"observed_at":"2026-08-06T22:29:28.463737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T22:29:28.485026Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.485026Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:3745ee5826a71eb02c3631dcfa672bce35a01d73d8d66bf14ca245c585ec3cba","observation_id":"ee98e613-7690-4797-9504-94d2f83e0d75","resolution":{"observed_at":"2026-08-06T22:29:28.485026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T22:29:28.505793Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.505793Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:93697d50e16eb31234980e5893239d6dad4eb0ffefdcad1c063d3e5ca6d02f86","observation_id":"f7352591-2e0a-4fc6-99aa-2ddd81b2977a","resolution":{"observed_at":"2026-08-06T22:29:28.505793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.514846Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.514846Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:7ba4180258aa76d938e5833b0aa9b0e686d54ced6addefaf93321ede76a76fa7","observation_id":"b32addc3-6660-4748-8b35-0f3b99ab08f1","resolution":{"observed_at":"2026-08-06T22:29:28.514846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T22:29:58.645747Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.645747Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:e111a92daee5dd54dc75efadc2106920f2ab070f8de1a663ba5aa6d26e4d0a4e","observation_id":"f559c9d4-cc7e-4725-96c6-91dcc2de487d","resolution":{"observed_at":"2026-08-06T22:29:58.645747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-06T22:29:58.670138Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.670138Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:18ff62917dcb554b9b8282d6bde1f59b260f23ed46e89fb1062dea0a4843dbd2","observation_id":"4f21f1cc-1561-4ae4-b7f2-662c6d7cd173","resolution":{"observed_at":"2026-08-06T22:29:58.670138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T22:29:58.699089Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.699089Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:63d2284041a4f28d27698b23a4d105a9ac50bf9733929cc2edde4227f7742a84","observation_id":"b9d0598b-3945-4573-bf7d-2516c8da6e38","resolution":{"observed_at":"2026-08-06T22:29:58.699089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.123124Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"61bdc3f1-0d81-4178-9917-cef43d1faf2d","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.706228Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:1560a4a9c9a7ebc6cb81b7c86b438d15e6fa36d06b1509ed367dd92482d4da77","observation_id":"9cb4bd50-cb27-4851-be18-111a1b7de6e1","resolution":{"observed_at":"2026-08-06T22:29:59.144612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T00:05:38.940053Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 4 inbound Pith citation observations for arXiv:2506.21655."}