{"as_of":"2026-08-19T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0aae0fc9e2f2b5423d5de5e947a29c84b5110731d7acead742a878f98bdb94a8","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:55:57.691185Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07801/citation-record","integrity":"/paper/2606.07801/integrity","json":"/paper/2606.07801/citation-record.json","paper":"/paper/2606.07801"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:d29b4e8a351444547ae8f096a1e9f1032a3c67be33b2f74e853d736b7b493cf0","observation_id":"e99716a8-8d0d-4069-95af-b38b06c19a9c","resolution":{"observed_at":"2026-07-02T17:37:14.804063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Dense point clouds matter: Dust-gs for scene reconstruction from sparse viewpoints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:75e55934c70126245dd0fd9402e70fbb35ad69ba7657ad0e667b32677423d1fd","observation_id":"42ee378d-0bf6-42a0-b4d0-4eaeb16dfbb3","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Benchmarking multimodal cot reward model stepwise by visual program","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:c98eaacb846169f5e856835b30a0dae10bc7f57065914b85380194ba2aacb595","observation_id":"1e87c439-2e8c-479d-b3b7-fb1e0b63ebf1","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":"2501.04519","doi":"10.48550/arxiv.2501.04519","metadata_source":"pith","pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","venue":"cs.CL","work_id":"49792b83-569e-4f5f-ae80-e96cbd3b7a43","year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:58036efa53e0355a59c97dd4a1ffe23a206de0842b8ff562663c120df9220615","observation_id":"90d15e96-d409-4d4a-9b50-c4a9c5f5f5ca","resolution":{"observed_at":"2026-07-02T17:37:14.796624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.797750Z","title":"Learning an efficient optimizer via hybrid-policy sub-trajectory balance.arXiv preprint arXiv:2511.00543, 2025a","venue":null,"work_id":"6595f83c-0c30-4d5e-bd97-584fee94195f","year":null},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:d9db041f3849a29152cb0ef4af1d92aea20b48ebf9bde7ec7dfca623590e7227","observation_id":"19bb96d0-9e8c-4f33-afbe-a965f5575564","resolution":{"observed_at":"2026-07-02T17:37:14.799262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:4aa5420851847cbc46e8b2a7ac5d45f58359a09f76b4dab59354527fcf10d706","observation_id":"24ae5da2-89f5-40b5-8ac2-44bdda8cd960","resolution":{"observed_at":"2026-07-02T17:37:14.801732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19929","last_updated":"2026-04-10T11:31:02Z","snapshot_observed_at":"2026-08-16T08:33:46.996440Z","submitted_at":"2026-03-20T13:17:05Z","title":"RAM: Recover Any 3D Human Motion in-the-Wild","version":2},"cited_work":{"arxiv_id":"2603.19929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19929","snapshot_observed_at":"2026-07-03T23:59:06.533950Z","title":"RAM: Recover Any 3D Human Motion in-the-Wild","venue":"cs.CV","work_id":"0b39eef8-2397-453b-883d-3a7d1c0a4440","year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2603.19929","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:e0a3d46908bbbdcd6e374524b97a32363dfdcb1b819f06b25cec667479bc32cf","observation_id":"c4b1e95f-ddcc-40fe-9b71-065d8c920170","resolution":{"observed_at":"2026-07-02T17:37:14.791400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:97388d2d4654c33216f9d7380550711fc44c22e15469158f8234c062e07a6298","observation_id":"25bd7bbc-51e2-4960-a9a7-2369903036db","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Nv-embed: Improved techniques for train- ing llms as generalist embedding models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:3daf1bd4b475fe6644e1c255076e8e06474125faa502d4446243423f0d925b3b","observation_id":"df5a02d2-53bd-4e78-9d48-61a9d1396adb","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:6dbe4a3bec77565883134b11b62ffebd74a9e1150bf243f8741d3aa5a9603707","observation_id":"b252fc26-6f34-4ea1-a859-b48504e39f71","resolution":{"observed_at":"2026-07-02T17:37:14.793531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Human motion instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:6436fa778a396e8da83c50d84afdc6fe91d358e1defd3af2ee9e4e96b065eaab","observation_id":"d8c4b3ab-19e6-4b6c-b1d3-b51974ff04ed","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Multiple human motion understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:0f75ed95f39283085ac7f7c9787472b8a806a3a67fd252cb5f0eb0c843cee39e","observation_id":"2da19a14-8f2a-4170-a16d-5140d9c2529b","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Image semantic segmentation via chain- of-thought prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:b9b3c826870caff7f7dd13f8dd81b43cdeab88ca81d3c53947fbdbc8f2996bc0","observation_id":"5123f71f-8df4-4444-b6a4-f8e799718f51","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00091","last_updated":"2024-12-06T02:26:29Z","snapshot_observed_at":"2026-08-18T08:50:46.170619Z","submitted_at":"2024-11-27T12:41:23Z","title":"Graph Canvas for Controllable 3D Scene Generation","version":2},"cited_work":{"arxiv_id":"2412.00091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00091","snapshot_observed_at":"2026-07-04T00:29:15.871521Z","title":"Graph canvas for controllable 3d scene generation","venue":null,"work_id":"c70945b4-31fc-48fc-8335-b73aa4bef2a6","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2412.00091","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:57a2ae9ecf91dc3f25088bd8369fadc04e1a8992114cb5eef64c9c4f332f1839","observation_id":"dbdd4309-6d32-4d6a-a1b8-24a3a0c1e1f8","resolution":{"observed_at":"2026-07-02T17:37:14.788803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:89566fb641aae39a2ec896d9f588d3491d7ccdfdab8d76d144b80dd1925d0069","observation_id":"3c249712-ad54-499f-be1f-103e69da9a96","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:6abb9703a3942629ba7282a7dc46c92f4df27ffe9d68c86f9df3d7e39583337a","observation_id":"758b02c2-9bbd-4c5b-96f8-58ff6ff3930e","resolution":{"observed_at":"2026-07-02T17:37:14.785734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":"2406.06592","doi":"10.48550/arxiv.2406.06592","metadata_source":"pith","pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","venue":"cs.CL","work_id":"9906447b-5bb3-4367-91f9-b9d556c9ee7f","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:b48d8205ec97538633928c3e6d81f0c38c50b240a8fbdbae65f8609bde83f326","observation_id":"2f0c2787-b8eb-4ac6-ac3b-af4567d8c2c1","resolution":{"observed_at":"2026-07-02T17:37:14.779823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Ursa: Understanding and verifying chain-of- thought reasoning in multimodal mathematics.arXiv e- prints, pages arXiv–2501,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:b9805f6dcc5ba6058dcfef991c1249fe1847e2dba8314381fc9a4992de1959a5","observation_id":"d3ad855b-e1b8-4020-baf8-8e4dfab5d167","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:a1d313eb8370ee5aae628b86fa92070f26e524e78c3951c382785261c0fd9882","observation_id":"42c34cba-879e-4744-bcf6-e8cacf0e4451","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.784842Z","title":"Training vision-language pro- cess reward models for test-time scaling in multimodal rea- soning: Key insights and lessons learned","venue":null,"work_id":"ac5bbf55-8c57-4eaf-b1c6-b4927a6d9838","year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:a148a8cdf1e42c3a062ddf141e51f557aba183d14b1aebe52010f346f422d702","observation_id":"97037d53-e865-4a65-b893-5b4ac21661ea","resolution":{"observed_at":"2026-07-02T17:37:14.786548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Mutual reason- ing makes smaller llms stronger problem-solver","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:5cd60a0693aaab033cd11d86a045dc439d62e304a0a1188497efd86937f6b49d","observation_id":"33052ebb-9bef-4d81-9bd2-ead709adf165","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:26d8d6f8d84b588cda785b5ac88c282a6cd0510445aef2fbadb8bfc0e112eb5b","observation_id":"929facf5-a1b9-4ebb-8c0d-5f5ea592d403","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Intrinsic entropy of context length scaling in llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:3016b46042771f6169fe0d13c920ab74646b435d54580b46a8d85cf3600bbdd2","observation_id":"ce4a326d-4a84-4e1d-98fb-fbab353ca368","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:52982fd91e339512bc06e0b427cc5e8725bf453a810fe1da428d8e831b5fdf0c","observation_id":"f87b0301-7f26-4395-b342-8f183e42b82f","resolution":{"observed_at":"2026-07-02T17:37:14.782921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:e47a20b70d64a517395d8b5333d42235a9d1bd8113cece77a9363e8e810b2607","observation_id":"ae37ca32-ec1b-424b-84a7-296d7e773a93","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:e1ebf9dd76e3fc02d2aa6040644ef3623a8bbb974da8d934c6c26328314e5f53","observation_id":"e942fe3f-4786-4ee7-9603-7cfadce43950","resolution":{"observed_at":"2026-07-02T17:37:14.791207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":"2411.10442","doi":"10.48550/arxiv.2411.10442","metadata_source":"pith","pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","venue":"cs.CL","work_id":"52f12dd6-1165-4717-9a1b-04ff19d82dfe","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:f32683b7df9571921949c063af4033420b0e70fb7ab5cda2ca4f38ebfdd79211","observation_id":"2a6a6c27-42be-4e86-9480-70f58ec5bcb4","resolution":{"observed_at":"2026-07-02T17:37:14.795919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Multi-step problem solving through a verifier: An empir- ical analysis on model-induced process supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:d3529edac3334e43288c48bdd24d7610a272f7f4fac5831db7c3825d43898609","observation_id":"b5cdf414-e7bc-41d9-8cf2-6a75999e1cc9","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-18T20:18:33.442413Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2503.10291","doi":"10.48550/arxiv.2503.10291","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualPRM: An effective process reward model for multimodal reasoning","venue":"ArXiv.org","work_id":"46b472b9-53d9-497b-9538-71913aa4aa92","year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:d655cf2797433f33bbec48efd88216be7f8fd69883e3bb6f462520fc3e130926","observation_id":"ed2bd02a-a54d-46d2-bded-3debe6d62791","resolution":{"observed_at":"2026-07-02T17:37:14.806679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.417798+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.417798+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18478","last_updated":"2025-06-02T14:26:19Z","snapshot_observed_at":"2026-08-17T07:40:53.859723Z","submitted_at":"2024-11-27T16:19:00Z","title":"Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS","version":2},"cited_work":{"arxiv_id":"2411.18478","doi":"10.48550/arxiv.2411.18478","metadata_source":"pith","pith_arxiv_id":"2411.18478","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InThe 2023 Conference on Empirical Methods in Natural Language Processing","venue":"cs.CL","work_id":"371ecd54-dfef-4cbf-a51a-01344cca2945","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2411.18478","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:89f7e6b57b406f2ee7c5d37b8326aa1eae27025345968357207712beb11a582e","observation_id":"8438769d-4f5a-4628-8cbe-782ad75e184d","resolution":{"observed_at":"2026-07-02T17:37:14.794057Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Llava-cot: Let vi- sion language models reason step-by-step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:a149101a2e99c6ab958a059d50874435065084297e32bee6e5bab214843b41ae","observation_id":"1fa0048c-73b5-486d-9728-3d95bf458f43","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01583","doi":"10.48550/arxiv.2412.01583","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"3dsceneeditor: Controllable 3d scene editing with gaussian splatting","venue":null,"work_id":"fe6b8251-0f06-4707-a60b-90f632669a00","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:166f332544e9dc9218f394367d67fdd60da2ed22ab5cfe64b539b5f21aefa933","observation_id":"c7a61164-452e-48ba-9eb5-6f29d76accd6","resolution":{"observed_at":"2026-07-02T17:37:14.777687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"3dsceneeditor: Controllable 3d scene editing with gaussian splatting","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:2b64fe7782ab2469541223ad47729c91136ace3389fc2fd0047d164b16d4b659","observation_id":"d65e27b7-5e6a-4f2d-a3cc-ef245e4b60f3","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"R1- onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:ced210d765cc46d032946ea410c6b9d4c9791dbdb2188a6a8680e684272b5f60","observation_id":"ecabd59b-c43d-436f-9fff-09a342fea043","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:51ddab5966565694792df0b71c44315ef5d86adb50c8f9913de6e9d4a59ee703","observation_id":"fa942ff7-cf88-43d2-829f-3c3093c309c9","resolution":{"observed_at":"2026-07-02T17:37:14.800932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"CountLLM: Towards Generalizable Repetitive Ac- tion Counting via Large Language Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:8978c4bfeff40edaf4925031ad61f2aacc9cb90c7b30c9dec4e923c43154f64b","observation_id":"e6e906a0-c40e-4b76-b3fc-8c7fffef406a","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.Advances in Neural Information Processing Systems, 38:29918–29952,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:6e6b943fa94aa17c54bca4edabf83105334905066095c80ae69c57fcba3fedcf","observation_id":"6ac6dba7-02a7-4b3a-8b5f-4fd4f7bf9966","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:dd1e44efc77c43e9fe421a1c4483165dbc31a847834c5627f63565e37ff9f73e","observation_id":"8834c047-b995-4af3-8186-267c35ef4b62","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:55:57.691185Z","title":"Birch: an efficient data clustering method for very large databases.ACM sigmod record, 25(2):103–114,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:3cf18a55d5037b06a3a08016b6ae949c38f8910eacb373f54ec55296f9de8471","observation_id":"38a49562-928f-4857-97b0-29744c044a89","resolution":{"observed_at":"2026-06-27T21:55:57.691185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":"2407.03320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-07-03T20:38:56.215264Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","venue":"cs.CV","work_id":"930005ca-91e5-4ee8-a634-1684c76d8cf9","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:e9fa5e00aebd385592dcfa841633b7bff7e6e4a60cd635103f514afd796442af","observation_id":"771d9f0b-3317-4172-85eb-b6f208f24f83","resolution":{"observed_at":"2026-07-02T17:37:14.769228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:03fe51e25193219721bf2377e792d9f3bc80effcc60fdfecfe80875b069890ad","observation_id":"f16d2f8c-7666-4f98-9902-0b828bb51fff","resolution":{"observed_at":"2026-07-02T17:37:14.803241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.00463","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.797018Z","title":"Psgs: Text-driven panorama sliding scene generation via gaussian splatting.arXiv preprint arXiv:2602.00463, 2026","venue":null,"work_id":"56d9a6dd-c3a0-4683-b579-1738d456fd88","year":2026},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:a4cb61b1aca24d0991e60651f98985da5e9289d667aad83482ea2379874b67b7","observation_id":"fc809c8a-8792-4516-8ed5-4ec02286e17d","resolution":{"observed_at":"2026-07-02T17:37:14.798473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":19,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2606.07801."}