{"as_of":"2026-08-01T08:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:817da575941a709dfd63d8fc0064a70fd9b2db055296b8601aef01f8e0453395","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T04:48:26.355351Z","state":"measured"},{"denominator":177,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":177,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":188,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T19:27:29.843866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:5a704d2ef057cdc8cb1ae89d08da22d0ef4824c28db7d5484f4d23395763607d","observation_id":"2588ccd0-f7e3-4828-9f7f-5775d893a168","resolution":{"observed_at":"2026-05-19T11:55:30.179227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:1431e9910e3c77c9ad1921c42d6c1a112f2c164e0027eeeb58fc6c353aff7dcb","observation_id":"70b50022-3abd-4c81-bea8-5d283a80d8d0","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2509.07553","last_updated":"2026-04-03T02:36:28Z","snapshot_observed_at":"2026-07-06T22:26:22.911328Z","submitted_at":"2025-09-09T09:46:01Z","title":"VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T18:06:12.349285Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.07553"},"observation_digest":"sha256:76e08874fdd8368f24b55bb78a301d5f71e5675e4ec853bee0bcada8c07a1bfe","observation_id":"9118215b-73d7-4e4b-bfa6-04ccd9dc88fe","resolution":{"observed_at":"2026-05-18T18:06:42.564542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2509.13281","last_updated":"2026-04-21T07:53:45Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T17:35:36Z","title":"RepIt: Steering Language Models with Concept-Specific Refusal Vectors","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.13281"},"observation_digest":"sha256:c8e7a3513b83dfe9724be31e8f8d808413bdf82d8e5b70520557e8ef108b7bac","observation_id":"4a8bdd1e-5291-4f21-a081-9e8b64bd5e74","resolution":{"observed_at":"2026-05-18T16:06:34.627607Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2509.18169","last_updated":"2026-04-20T12:46:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-17T10:15:25Z","title":"PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T16:05:57.505355Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.18169"},"observation_digest":"sha256:51bf4faee7f14110a54b61d7e7a581dadaaa14957aa46e6cd12811e333b5d8c8","observation_id":"f159faf4-89ee-4404-8c04-950a21f329ee","resolution":{"observed_at":"2026-05-18T16:06:34.878621Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2510.10073","last_updated":"2026-04-14T02:53:37Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T07:18:12Z","title":"SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T08:14:51.102085Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2510.10073"},"observation_digest":"sha256:4e4dd9aa5125e6e0a0de192901e9d8f3a6281697f2e88324fd96c897a4ba36eb","observation_id":"0800ca9b-3731-44a1-b6c0-1a44082198da","resolution":{"observed_at":"2026-05-18T08:16:06.474138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:847828a83ed809759218309cae99ff686f763a6528ea71d9c3faf9b346d6a963","observation_id":"bd699a5d-3ef4-4bbd-9808-05ad9436106a","resolution":{"observed_at":"2026-05-16T16:29:13.983934Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:d658aec8caf13624f2fb5e54d5efbdba78a2caebf2fb65a94724d15880456411","observation_id":"d56bec6f-774d-4c95-9ee0-4f1f46841545","resolution":{"observed_at":"2026-05-22T12:31:32.167022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2511.21678","last_updated":"2026-05-02T09:08:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T18:55:08Z","title":"Agentic Learner with Grow-and-Refine Multimodal Semantic Memory","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T04:27:40.232015Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2511.21678"},"observation_digest":"sha256:bbc5f22ca627889c0e7681a7c1e06c2c3669b15c2267eabc3103fecabdb0a55a","observation_id":"0f9fd3c1-90cb-4d70-851b-db82c128c335","resolution":{"observed_at":"2026-05-17T04:29:01.590494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2512.10371","last_updated":"2026-05-08T09:40:02Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-11T07:37:38Z","title":"AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T23:42:25.086602Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2512.10371"},"observation_digest":"sha256:32440a9745de93c575c73f08571f22fcc29b92101dd0fc6f813afba55507b78f","observation_id":"c5e84e16-7e9a-49db-a209-f35e3638e387","resolution":{"observed_at":"2026-05-16T23:43:42.344573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2512.12598","last_updated":"2026-05-18T03:43:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-14T08:35:04Z","title":"Setting the Stage: Text-Driven Scene-Consistent Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T17:40:25.779794Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2512.12598"},"observation_digest":"sha256:b0594be45caed179380f1b9dcc92976893b76fdb282d2fa3ce53ac895cd7caf6","observation_id":"e4860a6b-921b-4252-b950-e8b27b77849b","resolution":{"observed_at":"2026-05-21T17:44:17.309434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:7abfdd59771c55742971f87f4f1fb42fce6e48598c9a952f0317d2a1dc41ec95","observation_id":"a90fe606-918e-458a-b62a-bef10b4b8355","resolution":{"observed_at":"2026-05-16T23:03:38.931235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-07-06T22:40:02.746573Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T19:44:11.032898Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2512.21334"},"observation_digest":"sha256:26a2dc060cee4e0a9a4d75e6916907bcf1f91ce62ee0d71a9e03461ba42fd0df","observation_id":"7f0461e3-46d1-41b9-b3c3-44d0c312626e","resolution":{"observed_at":"2026-05-16T19:48:21.813161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:b53a155516fcc6f4dc299a330a80e025ed4dd0b1fea0eb1602ec12ac4544921c","observation_id":"18c44e9b-5659-42ca-8b99-1dc690279dc6","resolution":{"observed_at":"2026-05-16T04:21:29.895201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2602.01785","last_updated":"2026-04-28T16:05:53Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T08:10:21Z","title":"CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T08:30:50.984873Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2602.01785"},"observation_digest":"sha256:5bc6b51a5e5102967fa9506b3c2c0036377e51f6a7185a75106636091fcbbf06","observation_id":"c27aff3e-1747-415c-bbb0-2e18a49288c7","resolution":{"observed_at":"2026-05-16T08:32:36.417528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2602.03916","last_updated":"2026-05-10T15:38:24Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T17:52:02Z","title":"SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2602.03916"},"observation_digest":"sha256:f92414480222adcb78293f1b585da489bc0105cb2983710d5328227d3ff72ccd","observation_id":"63d80ec6-ecd4-463b-8303-c5004db8a284","resolution":{"observed_at":"2026-05-16T07:57:33.005453Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-07-25T23:21:26.056400Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T13:36:28.844714Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:134d5499f53bbaf5ff37f3bcd42a3c3cd627130846ee8470ba6a0b9f55e69756","observation_id":"a3b31a65-1a7b-4ee1-96ee-61bdbeb327b4","resolution":{"observed_at":"2026-05-21T13:40:12.595718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2602.22683","last_updated":"2026-04-09T08:16:21Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T06:55:48Z","title":"SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T19:18:36.314029Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2602.22683"},"observation_digest":"sha256:2e549da17ae1805d6fcb2cb1d1477a0a502e83633f34cec29335449cdcf023f4","observation_id":"665bb61f-ac43-4421-b26f-32fae272198d","resolution":{"observed_at":"2026-05-15T19:20:16.450466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2603.04415","last_updated":"2026-05-09T08:44:16Z","snapshot_observed_at":"2026-07-06T22:47:50.848191Z","submitted_at":"2026-02-04T04:13:39Z","title":"Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:25.063204Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.04415"},"observation_digest":"sha256:1a776cbf93dccaae0bcb63658a5bfdd612a890a45f106998df524910326e4139","observation_id":"d190f107-bbf6-4d5c-aac3-9387529d2fe7","resolution":{"observed_at":"2026-05-16T08:12:35.481553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2603.07119","last_updated":"2026-05-04T15:27:59Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T09:11:10Z","title":"TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T14:32:59.720416Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.07119"},"observation_digest":"sha256:2a9765f9165ee2a5e204c9903999250482ed50a526b875d73626359c44464f28","observation_id":"4aad42c3-e306-4451-924a-40c9ff6b7a89","resolution":{"observed_at":"2026-05-15T14:35:55.844251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2603.13091","last_updated":"2026-04-17T08:06:30Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-03-13T15:40:42Z","title":"Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T11:28:29.772341Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.13091"},"observation_digest":"sha256:f722c0df64a949fb1afc118108c15fe7f2f4a8b1df788474794fdc4bc0252a02","observation_id":"d26eaf49-3a9d-46ac-8400-7e5073358044","resolution":{"observed_at":"2026-05-15T11:29:58.752853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-07-06T22:50:14.856451Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:e0351539c6af698ccc7cd29ff2eb41f2e00ae6e4c57e418275ca0d4c89cf5259","observation_id":"6c5a865c-580b-4e09-bda0-81adaee0d878","resolution":{"observed_at":"2026-05-15T00:58:25.535528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Glm-4.5 v and glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning.arXiv preprint arXiv:2507.01006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-07-13T18:42:32.163637Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:bd8e5bc1a1528e7fe272ffd0a9da341cea8ef09b7569f49e3841222a2f989a89","observation_id":"0829e7d9-7d9b-45d9-ae28-c5f2f7dca782","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2603.29632","last_updated":"2026-05-09T04:25:23Z","snapshot_observed_at":"2026-07-06T22:51:18.036225Z","submitted_at":"2026-03-31T11:57:00Z","title":"An Empirical Study of Multi-Agent Collaboration for Automated Research","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T23:43:30.595949Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.29632"},"observation_digest":"sha256:85a65344c29b6e2e9722c50b65868364e3001fc2fe30aa17d86589f621c20136","observation_id":"a6578ab0-b2bd-45d4-8505-a2a07a42b096","resolution":{"observed_at":"2026-05-13T23:48:27.869428Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-07-13T15:50:48.216413Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T23:53:19.148407Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:37afd0da9fe99e98dd46c586f473788c597c2a838737d7f764e620e2ba8247d4","observation_id":"4888092d-2e6b-4092-9169-c471d3e22492","resolution":{"observed_at":"2026-05-13T23:53:28.008584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-13T15:50:49.083652Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-07-13T15:50:48.216413Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T15:50:49.083652Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:6ffae28eb35d06695048edfb522c08158d6d779b0572de826247bd28417ef842","observation_id":"6e043041-0dff-400a-86a3-3e434df7a6ca","resolution":{"observed_at":"2026-07-13T15:50:49.083652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.03081","last_updated":"2026-04-03T14:58:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T14:58:58Z","title":"Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T19:47:45.936608Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.03081"},"observation_digest":"sha256:e2498d5a516ee3c567969e5cec73332760b989d7d0802e869381a11c7c8adb4c","observation_id":"0128bfd9-4c23-4d5d-bca6-c814e0db1630","resolution":{"observed_at":"2026-05-13T19:48:11.205747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:1ce9055e18601259a6e6164e36b2ea64aa31fc5322f8ea1298c963b2a82cb533","observation_id":"a7337034-55da-4371-be1d-acc7ade04578","resolution":{"observed_at":"2026-05-13T20:33:17.102039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:959ff7d7be1076a002a5c79ddf59aebe40b37798e7a9a59087ed9a21dcdb88f6","observation_id":"0e1e5d5d-783f-430d-a9bc-807341bca6bf","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.05557","last_updated":"2026-04-07T07:58:55Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T07:58:55Z","title":"EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:31:15.525331Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.05557"},"observation_digest":"sha256:9cf18468ce6d0c762c4ddf6b084bbfc32d580f6bbd66bc20cb45d7aebf992058","observation_id":"f497adda-e158-4e2e-a6e6-34b888c95ba7","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.05623","last_updated":"2026-04-07T09:27:01Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T09:27:01Z","title":"DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:29.592129Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.05623"},"observation_digest":"sha256:a350742c85754015e98380d283d486962a64504a7b8e5ea5ad551d80dfe83c3c","observation_id":"a63fa3d1-5a51-4d3a-b648-d7fd4bb35cef","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.06505","last_updated":"2026-04-07T22:34:02Z","snapshot_observed_at":"2026-07-30T04:43:43.542176Z","submitted_at":"2026-04-07T22:34:02Z","title":"MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:50.613703Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.06505"},"observation_digest":"sha256:f9ef895d78ada20b9de926938b5af47749728358f8e6ece73c2e988fa00ead47","observation_id":"2a0ae7f4-506c-4060-a33a-c52355aace96","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.07429","last_updated":"2026-04-08T17:49:03Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T17:49:03Z","title":"GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:57:36.038091Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.07429"},"observation_digest":"sha256:7d9c4b7add8eec18808194dec53008d759ac5ae5ee93c4dacef6ec447c489ae0","observation_id":"0e71f657-05e2-4345-8aea-d168494f816a","resolution":{"observed_at":"2026-05-11T05:46:07.006010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-04-09T15:12:36Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:12:36Z","title":"PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T17:59:48.877783Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:29634051f11eefa64a81fb5b0fe7590549eb4dd52d805ad0e58e6a115a7076d1","observation_id":"f2eeac52-ac62-4155-a0c4-3403a56ccf7d","resolution":{"observed_at":"2026-05-11T05:41:00.379965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:34.401698Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.08516"},"observation_digest":"sha256:174c2c35fb64d93c93b2932ee4dde7fc5b85dbbc5e934e525e187d5e40027794","observation_id":"37af00b6-d404-447e-ad63-f7c0a63bbc6b","resolution":{"observed_at":"2026-05-11T05:40:58.869456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.08884","last_updated":"2026-04-10T02:47:32Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T02:47:32Z","title":"HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:49.114269Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.08884"},"observation_digest":"sha256:ac25a2316b65430e87343645f678b018cfbac9e1a9f43a245e2bc290f9a93166","observation_id":"b5e052d6-d844-45f6-babb-bbb3b42b0d9e","resolution":{"observed_at":"2026-05-11T05:30:57.716383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:0063eb24aaa61fe89711d05d2e6f9d0e923e976efbee66e922673920c0bc6166","observation_id":"76f18d35-067c-4f3a-8eb9-3d830a62c0f9","resolution":{"observed_at":"2026-05-11T07:00:59.478488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.10755","last_updated":"2026-05-13T15:52:47Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:53:02Z","title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:59.205848Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.10755"},"observation_digest":"sha256:dea45eb26ea8f197a767f49966b7e9287011f262efb6f6c0011d1a91bf2b0ce2","observation_id":"3c7a35d8-e3ac-4996-b3c9-a2e2a63e463c","resolution":{"observed_at":"2026-05-11T10:21:01.352426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.10755","last_updated":"2026-05-13T15:52:47Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:53:02Z","title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:17:20.190144Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.10755"},"observation_digest":"sha256:3a5b8968c91a67682f4c440a82c1ea0d33ead5e967ae39dd56123a0193b1182d","observation_id":"f43525a7-90e0-483f-9a8c-6d836a29463a","resolution":{"observed_at":"2026-05-14T21:17:58.582638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:a29ce5f75f7767e517d88ba4fa1649fad7f2c6a6a64e7f9666dbadba9ff488b3","observation_id":"f81df95c-acf3-4855-8fa6-8977c9e50e80","resolution":{"observed_at":"2026-05-11T10:41:04.354487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12282","last_updated":"2026-04-14T04:47:21Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T04:47:21Z","title":"Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T15:32:54.053527Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12282"},"observation_digest":"sha256:d24ec4c6744d4c70cf5dc2140f2440060545ed382c5f97166f3526955d40b2d6","observation_id":"c1666d75-9171-4363-8d40-8051121b4efa","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:fdc95f842aa77df314a1e699e40e4e0cca0d4c4f11306f7aaf6d7bcbe09460d3","observation_id":"22751ca3-1fa3-42b4-86ed-72ee9de514a1","resolution":{"observed_at":"2026-05-11T11:31:01.391919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12616","last_updated":"2026-04-14T11:44:59Z","snapshot_observed_at":"2026-07-06T23:00:46.620106Z","submitted_at":"2026-04-14T11:44:59Z","title":"Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:06:43.140580Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12616"},"observation_digest":"sha256:2794a44078fc128ccfcbff382a4b606d76bdcb4ceef7308d208304d5f7046404","observation_id":"0400511a-8c66-4178-8e4d-f5134b8ad98e","resolution":{"observed_at":"2026-05-11T11:11:05.467585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12812","last_updated":"2026-05-11T03:47:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:39:26Z","title":"DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:16:58.889065Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12812"},"observation_digest":"sha256:3721bb09432fdb0a84d6478efe7f90b6b5949ae316ac2c9045dc4a5c124b0b91","observation_id":"6aa484e7-3653-45b9-a2fb-68000744cbed","resolution":{"observed_at":"2026-05-11T09:05:58.510332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12812","last_updated":"2026-05-11T03:47:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:39:26Z","title":"DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:17:55.318813Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12812"},"observation_digest":"sha256:ba7dd135f8cec6dd9e4b8683102c03c5d4985ad787b73ae665c0521a446a2fe4","observation_id":"93677088-9fc0-4b52-9cd7-417245b290a3","resolution":{"observed_at":"2026-05-12T06:26:24.479026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.12929","last_updated":"2026-04-14T16:19:12Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T16:19:12Z","title":"Grasp in Gaussians: Fast Monocular Reconstruction of Dynamic Hand-Object Interactions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:01:52.354836Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.12929"},"observation_digest":"sha256:4fa7099d2859d7cc69a6b6fb5d9d14e242eadfe2d6810c145858e5cbe23bbf37","observation_id":"888eb7aa-7eaf-4144-b8a9-766de0f543af","resolution":{"observed_at":"2026-05-11T11:21:00.498276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.13531","last_updated":"2026-04-15T06:27:49Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T06:27:49Z","title":"RiskWebWorld: A Realistic Interactive Benchmark for GUI Agents in E-commerce Risk Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:40:55.540869Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.13531"},"observation_digest":"sha256:bf2851ff21048b64925c070a7a190f5e1e52d30a1bfd074797659f594d9ae16f","observation_id":"1b09a0da-7c9d-4814-9b01-bfd44cc74e5e","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.14785","last_updated":"2026-04-22T14:57:48Z","snapshot_observed_at":"2026-07-06T23:02:27.141640Z","submitted_at":"2026-04-16T08:45:34Z","title":"MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T10:53:48.374637Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.14785"},"observation_digest":"sha256:208eb93df4da82d7872e7abac57911bc838dc2f279bc276cefcbcba1c2edcb9b","observation_id":"9b7a13d4-c3cb-4a69-887b-cdbc26a71b74","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:df7a8ada9b252fc2d3ceda8ae795a59cf6b3f2ce06f9ee1c96b7613c3114ccee","observation_id":"25c3b223-320a-4250-99b3-58a83036e7ce","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.17172","last_updated":"2026-04-21T04:46:04Z","snapshot_observed_at":"2026-07-06T23:04:19.063534Z","submitted_at":"2026-04-19T00:05:36Z","title":"UCCL-Zip: Lossless Compression Supercharged GPU Communication","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T06:36:43.101810Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.17172"},"observation_digest":"sha256:355dd42c14a6bc47cdaa70db7b827e5b891636e58e119170aaed1e30f780d329","observation_id":"9dbacffd-9dd8-4239-bafc-960e4dff3872","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.17385","last_updated":"2026-04-19T11:21:59Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T11:21:59Z","title":"SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T06:31:30.778309Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.17385"},"observation_digest":"sha256:b29345bf55c4e547d7f171dd47f34f8ca91411bb8d11d3e6cc0ea13b198a7314","observation_id":"62813321-8680-4086-b857-6f965d1a5945","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.18572","last_updated":"2026-06-02T17:45:12Z","snapshot_observed_at":"2026-07-06T23:05:26.398712Z","submitted_at":"2026-04-20T17:56:02Z","title":"Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T05:00:31.717115Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.18572"},"observation_digest":"sha256:a5c02f1e8bdf6b2c246980b46a7e8fcf41cd05fe1ef5fa6d3dabfdb7dc125298","observation_id":"92382599-35b1-4db0-a685-3c2fefa791a5","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.19048","last_updated":"2026-04-21T03:55:02Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T03:55:02Z","title":"SAMoRA: Semantic-Aware Mixture of LoRA Experts for Task-Adaptive Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T02:26:55.896058Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.19048"},"observation_digest":"sha256:8a00662b180c5d57781a98f15a3ccfbb6f8692abc342b33f9824eaa2a2d6ba8a","observation_id":"2e2a2385-da03-429e-89b7-719fe78fadb0","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:33.668451Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:edd503fe6d559293b89e7b4de7dce6dc890937f4e3039a040490329c0dc1487d","observation_id":"41e74320-884e-4b83-a233-b4ed61a4eb34","resolution":{"observed_at":"2026-05-11T13:41:04.095036Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-05T04:29:52.480873Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:061060edcc1892bf9c4a10f97246f59f23ddee744f99dc4e1c752ddef66ff7f0","observation_id":"54642419-d86a-4860-8dc9-909ce3a9fa88","resolution":{"observed_at":"2026-07-05T04:30:40.733541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.20350","last_updated":"2026-04-22T08:52:50Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:52:50Z","title":"X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:04:07.511600Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.20350"},"observation_digest":"sha256:85f292eb42c98f8069af9a0b4924d1f84588be480a94022fa6fdacc960a1eb5f","observation_id":"35d8cbce-a93e-45bd-a3d9-81a0247cd289","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:45:50.422679Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:8db8bdb66b1a7702754c98cd0b5c0f388a85cfa4fff1901a31025596cf6c6743","observation_id":"a1f24032-cb80-4956-9d9a-04c72cec029a","resolution":{"observed_at":"2026-05-11T19:06:08.908919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:5bfee3b94fbf641a02b2bdaf0f8ccdc6b40af5dcbad8e7184190f17e01deb54c","observation_id":"49742b1b-818c-46b5-b4fe-76bfbec4b988","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.22558","last_updated":"2026-04-24T13:53:39Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T13:53:39Z","title":"SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T12:09:24.371878Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.22558"},"observation_digest":"sha256:400b6f59951cd5ecb0237c4f14718defe419af1e8146cd9d016aa1f0ad833c35","observation_id":"615ba1d5-a79a-4ff4-a91a-cc32a2e02b40","resolution":{"observed_at":"2026-05-11T19:21:08.864116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.22840","last_updated":"2026-04-21T11:59:03Z","snapshot_observed_at":"2026-08-01T00:33:13.002965Z","submitted_at":"2026-04-21T11:59:03Z","title":"AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:18:05.770211Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.22840"},"observation_digest":"sha256:5ffab156baa6dcaed369a5a50ec12140e0ea8b6bc3d4e5c430029cb823e23f8e","observation_id":"07440cff-76da-4452-89a5-20bd170dda9e","resolution":{"observed_at":"2026-05-11T13:06:06.001569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.24348","last_updated":"2026-04-27T11:44:26Z","snapshot_observed_at":"2026-07-31T20:25:37.534799Z","submitted_at":"2026-04-27T11:44:26Z","title":"OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-08T03:51:54.310805Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.24348"},"observation_digest":"sha256:1f642b45709029de9d51b9746f77e496020776077fd3f37cdf4bb9242afb1174","observation_id":"44678f3e-8fe7-4ef5-844f-b3b260aeff71","resolution":{"observed_at":"2026-05-11T21:56:11.922010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.25806","last_updated":"2026-04-28T16:15:04Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:15:04Z","title":"MAIC-UI: Making Interactive Courseware with Generative UI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:31:14.775887Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.25806"},"observation_digest":"sha256:01d9ba013f77531569e814b5261e6f01734684fd3f2fd18b39d4c3fd71201437","observation_id":"8cf4b577-08a0-4887-b9c4-52e91c47ca99","resolution":{"observed_at":"2026-05-11T23:41:16.190174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:ba94f24ee0523e99ea8d980c0a9d56bc6db492311ce83955c2f7cad987892fc1","observation_id":"2db88b3a-f500-4da6-8045-80dbbba9d601","resolution":{"observed_at":"2026-05-12T10:11:28.117403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:df8de7be5186cabc959b2fef07eeb431696c26b434529f7b0752b8724435aa30","observation_id":"267d1350-c38a-4ca0-bf6d-2cc1126112fa","resolution":{"observed_at":"2026-05-11T16:01:22.921669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:5e152c1350f5794256826de83d3cd9536b22ef8296ecaddaedafe8225824d78d","observation_id":"b62ed2c1-c01a-4d14-b46a-d69bdc82a006","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T01:24:56.236650Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:357b292231d4187e0cd0163f5f74d8afa340b0e74dcf6e9828376d0e970187fb","observation_id":"8e8cba20-9306-4351-b01a-b497090f2b0f","resolution":{"observed_at":"2026-05-12T11:01:30.251232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:12.092478Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:f7c0b5c852c142f960d96e399f412c3a72b9ac807c4f422d39a849b092b07292","observation_id":"935adb88-c659-4040-ab92-d51f559f1556","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:33:55.317107Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:5bdf27892ec4d04c82c8cea37624a73608fede2794a9d1ebaafda29a3e2760da","observation_id":"eff6ba23-677e-498c-ba15-b2d125256af3","resolution":{"observed_at":"2026-05-12T07:51:48.384089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.05832","last_updated":"2026-05-07T08:08:52Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:08:52Z","title":"MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T11:20:09.769711Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.05832"},"observation_digest":"sha256:19c8e12bfa85c7df6e6bf09921c8ce32ba334c838350af7e41de6c0d92662758","observation_id":"3ab22951-39f3-4335-addb-5a00006360a5","resolution":{"observed_at":"2026-05-11T19:41:08.283888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.06234","last_updated":"2026-06-09T07:34:06Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:22:26Z","title":"RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T09:12:00.835585Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.06234"},"observation_digest":"sha256:690ab048bc2cd4fcda76bd655942cbb2b68a1a15ca32fbf6460104bf2d0f0de4","observation_id":"4832bb9d-8ee8-4079-abdf-3eff57696c16","resolution":{"observed_at":"2026-05-11T20:26:10.086438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.06234","last_updated":"2026-06-09T07:34:06Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:22:26Z","title":"RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T23:27:32.526304Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.06234"},"observation_digest":"sha256:7df1aba7750040843f5d746ffbece858e90659a5c1995d58a5f442023636d851","observation_id":"b76a2b1f-a841-41fb-be85-cc10b149928d","resolution":{"observed_at":"2026-06-30T23:35:07.744441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.07250","last_updated":"2026-05-08T05:19:23Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:19:23Z","title":"Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T01:53:46.652759Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.07250"},"observation_digest":"sha256:ef1e6c8f0ae6756046689d0d38f5d9dd2719526ecc3779505566d5fa1af3eff9","observation_id":"0058aa81-88f8-41ad-ad39-6b1690f440b9","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08003","last_updated":"2026-05-08T16:57:38Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T16:57:38Z","title":"SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:12.267144Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08003"},"observation_digest":"sha256:d39f1ba5634da67725244f0bdc71809b95ba269704b6764c2125268aba47b07d","observation_id":"42b15f8b-58c4-4e55-b105-66d20b1088dd","resolution":{"observed_at":"2026-05-11T04:48:27.616218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08146","last_updated":"2026-05-26T13:04:47Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-03T09:33:08Z","title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T01:31:52.536354Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08146"},"observation_digest":"sha256:0ca372193c3ea29c136cbc36b672b81a2bb0ee8e63b02bff52d74000b14fa174","observation_id":"e731b2fb-a456-4397-9911-00e3eabb5758","resolution":{"observed_at":"2026-05-12T07:56:27.065120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08146","last_updated":"2026-05-26T13:04:47Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-03T09:33:08Z","title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-21T00:31:07.580063Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08146"},"observation_digest":"sha256:85a423c7aa37a170220acc049d13db35452f31d8cb94b016e7b7358c4498d113","observation_id":"e06f919c-1aa0-4eb6-9310-18ce54a1f0e0","resolution":{"observed_at":"2026-05-21T00:33:52.781109Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08146","last_updated":"2026-05-26T13:04:47Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-03T09:33:08Z","title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T00:20:19.699522Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08146"},"observation_digest":"sha256:25a2edaf7d24dea99d5cafb4cb8b10681a3d23e98a80504f3e68f980303a31db","observation_id":"04e26437-8037-467f-97b7-8c292930d701","resolution":{"observed_at":"2026-07-01T00:25:09.540399Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08334","last_updated":"2026-07-29T00:50:03Z","snapshot_observed_at":"2026-08-01T08:17:49.067904Z","submitted_at":"2026-05-08T17:59:23Z","title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:57.796883Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08334"},"observation_digest":"sha256:0e0e6c3132800653281eb6b76b3e780f3af3a47734acde2259896662daa7754f","observation_id":"bcd132f7-d687-4feb-838c-9fa298d9ccf5","resolution":{"observed_at":"2026-05-12T08:41:24.031189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08452","last_updated":"2026-05-08T20:17:44Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:17:44Z","title":"NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:23:04.253007Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08452"},"observation_digest":"sha256:323d0cfdf25cf52a594ae54062d143cdc34fbfb2445ee9e01e118dfa16ad3f7a","observation_id":"bc54c21c-69ce-4ce1-8ed0-42213428f5f1","resolution":{"observed_at":"2026-05-12T07:41:31.935060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.08709","last_updated":"2026-05-09T05:44:29Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:44:29Z","title":"UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:10:21.661074Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.08709"},"observation_digest":"sha256:2626c7606f1e903567aba28697969f5e14e48da2ae0a3bfb3b54fdd7889924e2","observation_id":"65afc766-0efd-4078-8373-53f248a51301","resolution":{"observed_at":"2026-05-12T08:26:24.389514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.09317","last_updated":"2026-05-10T04:31:23Z","snapshot_observed_at":"2026-08-01T02:53:20.108545Z","submitted_at":"2026-05-10T04:31:23Z","title":"Mem-W: Latent Memory-Native GUI Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:25:01.722487Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.09317"},"observation_digest":"sha256:514e27b127c142bae473e8e3a2eaa1674afad225f1451454b738a368b772968a","observation_id":"72fcc410-93e0-4801-9123-1a10dee9cd49","resolution":{"observed_at":"2026-05-12T06:16:29.126529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.11960","last_updated":"2026-05-12T11:14:25Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:14:25Z","title":"Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:44.584051Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.11960"},"observation_digest":"sha256:e03cfcdceefa16b81e2fb6d1822cbcbe4a181e408a93cbdab882800609de78cc","observation_id":"e20c92e1-5d45-4eb3-b4bb-c23b1756c8e4","resolution":{"observed_at":"2026-05-13T05:52:22.578907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:9f696331ed6e6854822bb90d8d61bbf6a7fd9c35811977554b96ec5666574646","observation_id":"910d930d-9505-4e90-aa85-34bfabe303fc","resolution":{"observed_at":"2026-05-13T05:17:18.674337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.13831","last_updated":"2026-05-13T17:52:53Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T17:52:53Z","title":"Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:16:07.851098Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.13831"},"observation_digest":"sha256:0d8a5ce1705d5636a0710f6e3a252d9a5490d09ed805d19fb610b1e502fb2014","observation_id":"5b0b0f08-1861-408e-a1d8-8e538c94fb45","resolution":{"observed_at":"2026-05-14T19:17:50.140441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.14291","last_updated":"2026-05-14T02:49:27Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T02:49:27Z","title":"To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T02:38:37.358485Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.14291"},"observation_digest":"sha256:2622274f46e7c79e90d3dd5c94900fccac224afcd1e11153280fc212f977ec9b","observation_id":"89f2234c-ecd8-4e5c-96c3-daba9360a9d9","resolution":{"observed_at":"2026-05-15T02:39:40.896473Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.14786","last_updated":"2026-05-14T12:55:19Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:55:19Z","title":"Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T20:34:38.525776Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.14786"},"observation_digest":"sha256:bfd8c776f062cdf2678e3fa2f2b3c0d94e00ad34425b4557fdad1441ea28d454","observation_id":"6ddb6e5f-7323-4d57-839e-8cf2ef724733","resolution":{"observed_at":"2026-06-30T20:35:02.262380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.14906","last_updated":"2026-05-14T14:41:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T14:41:17Z","title":"MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T21:00:25.664841Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.14906"},"observation_digest":"sha256:eca39cce29f8160056008342ceb09816a1a510b0e789c0eca9dd0ca5ca2c605d","observation_id":"ca8b9b54-550c-4c75-a874-9523bd6e91e3","resolution":{"observed_at":"2026-06-30T21:05:04.269776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.15963","last_updated":"2026-05-15T13:55:05Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:55:05Z","title":"PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T18:46:20.417039Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.15963"},"observation_digest":"sha256:0216eeafa9c0069d5fcf6ce7f3dada01870f4ba23dba0daba3f11711d1814c98","observation_id":"2cf03042-27aa-4fff-b330-dd7592fabdac","resolution":{"observed_at":"2026-05-20T18:48:53.318235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.17093","last_updated":"2026-05-16T17:33:24Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:33:24Z","title":"HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T15:37:09.899037Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.17093"},"observation_digest":"sha256:739ec108bc7e0ef2aa8a039d77402682b26f48abe042cd4b1940b7b399ae827c","observation_id":"1c71f3f7-b304-4afc-9ad5-02879aaa539f","resolution":{"observed_at":"2026-05-20T15:38:26.639128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.17228","last_updated":"2026-05-17T02:28:25Z","snapshot_observed_at":"2026-07-06T23:28:16.927009Z","submitted_at":"2026-05-17T02:28:25Z","title":"Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-20T14:48:55.203993Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.17228"},"observation_digest":"sha256:5adefd241c282ef14e28cf5564864bbcc1d89f24daf76f3ceb0749d403339fff","observation_id":"e9301826-9a2d-4d83-9bfb-b343eefbff45","resolution":{"observed_at":"2026-05-20T14:53:23.376726Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:974ec5ccf36bd66ada597bd8ac7e23fae6bd7ae3f090bb671cf66f1df0bc1a91","observation_id":"4cfa3ace-8fdf-4f21-8019-054710033a95","resolution":{"observed_at":"2026-05-20T12:03:15.440872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:94bf168e6609510faeae52c63b6eadee3ecd892e0281bd1ce3da144241fe027d","observation_id":"ea86a291-4383-42e3-97ca-ed5ac71a190c","resolution":{"observed_at":"2026-05-20T10:58:13.533037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:f0f139497b8ac9168287b6131e83b586151b7003dd5883dc668aca38a20180bf","observation_id":"7caccb5e-28da-4de1-be3c-1ed7752b756c","resolution":{"observed_at":"2026-06-30T18:35:00.686256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.18984","last_updated":"2026-05-18T18:04:54Z","snapshot_observed_at":"2026-07-06T23:29:47.081347Z","submitted_at":"2026-05-18T18:04:54Z","title":"Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T10:26:30.661042Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.18984"},"observation_digest":"sha256:1ea86c78a4350f3bb1bc010eca911974ad54737d84640e933554fcdfbc92e41d","observation_id":"2ace0ac1-81cd-473f-a744-b365884927b8","resolution":{"observed_at":"2026-05-20T10:28:11.982339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.19223","last_updated":"2026-05-19T00:48:14Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:48:14Z","title":"HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:38:08.819186Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.19223"},"observation_digest":"sha256:964584d3ad89738ac6066293b82847d8d1bd52e93f7761f610aeeefe95334b05","observation_id":"75780fc9-fb18-4b67-bc7d-502638b3bdc5","resolution":{"observed_at":"2026-05-20T07:43:08.497320Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.20286","last_updated":"2026-05-19T06:11:04Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T06:11:04Z","title":"Adaptive Probe-based Steering for Robust LLM Jailbreaking","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-21T02:32:49.034790Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.20286"},"observation_digest":"sha256:ef60bb0df8c2e770f93de7daca485abdd215fe7680e5d7369b7959e24b27df5e","observation_id":"ddc24d59-a4eb-44f7-99de-0af6043e7b06","resolution":{"observed_at":"2026-05-21T02:33:54.931423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.20490","last_updated":"2026-05-22T20:08:09Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:55:41Z","title":"ECUAS$_n$: A family of metrics for principled evaluation of uncertainty-augmented systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T06:42:18.133611Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.20490"},"observation_digest":"sha256:85be8ed53154554d893bd7dd6a2fdb38dbb0718a0a9ca8a82d272efaceaa07ce","observation_id":"818e1f00-b120-4fed-9d59-746d3ea142f9","resolution":{"observed_at":"2026-05-21T06:44:00.865303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.20490","last_updated":"2026-05-22T20:08:09Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:55:41Z","title":"ECUAS$_n$: A family of metrics for principled evaluation of uncertainty-augmented systems","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T08:55:07.587572Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.20490"},"observation_digest":"sha256:6567c7d0e635b4b836282136048817c8ec436241d03cca02ba2d4e6257671162","observation_id":"853f7783-7202-4481-aa1e-3d86cb75e130","resolution":{"observed_at":"2026-05-22T08:56:18.950186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.20490","last_updated":"2026-05-22T20:08:09Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:55:41Z","title":"ECUAS$_n$: A family of metrics for principled evaluation of uncertainty-augmented systems","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T17:54:38.066497Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.20490"},"observation_digest":"sha256:274e0f2eb0c144da1c8bbfc8c43d343d0dbed271c37d93b04c8d4b818e72892b","observation_id":"58ee22da-0a4e-4b43-9f9d-9050e36155ab","resolution":{"observed_at":"2026-06-30T17:54:57.697125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.21299","last_updated":"2026-05-20T15:28:52Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T15:28:52Z","title":"Tracing the ongoing emergence of human-like reasoning in Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T05:04:30.829386Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.21299"},"observation_digest":"sha256:bd96a594b0aef79f23e21a0e7104972aa95b8d6514c86891da73fcb343d30601","observation_id":"66d90032-417f-4b92-b5d5-c14b681cca48","resolution":{"observed_at":"2026-05-21T05:04:37.156476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2605.21541","last_updated":"2026-05-20T08:15:56Z","snapshot_observed_at":"2026-07-31T21:34:26.679076Z","submitted_at":"2026-05-20T08:15:56Z","title":"Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T01:25:06.528845Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2605.21541"},"observation_digest":"sha256:64f655458f900b5428da75cb16c991e1c6220d03c2d2f44b7fd3a19393878fb9","observation_id":"abfab5e9-1b23-4966-9193-c34f6f378029","resolution":{"observed_at":"2026-05-22T01:25:52.627292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01006/citation-record","integrity":"/paper/2507.01006/integrity","json":"/paper/2507.01006/citation-record.json","paper":"/paper/2507.01006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"89c88576-a755-46fd-9a33-f176380aae3d","year":null},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:d73b2468d43d661284c65a4358336a4af404a265057df1a3e168279ad460c205","observation_id":"0f95b7c9-4687-4c26-a1b3-b07c51f0fde0","resolution":{"observed_at":"2026-05-11T04:48:27.323386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cb7bafa5-f573-4cf4-8838-996a36cae632","year":null},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:7c1884e11ab6a4e82193a631e1a20f01557485c11407181e56fcd4de3fc489e9","observation_id":"9ddcf976-45af-4baa-a121-2c5ed0e47f5b","resolution":{"observed_at":"2026-05-11T04:48:27.276647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Awadalla, L","venue":null,"work_id":"451f0c2f-5445-4072-928c-391808b5ae0a","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:268e1c27f1a8305cb2b5b34e75abd38222df9f8bf06c2c3fe60ef5c2dbb762a9","observation_id":"0703c035-12af-430d-add3-ed115c692077","resolution":{"observed_at":"2026-05-11T04:48:27.292864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:acdad660784b5e40e43a9a12fae2ee31718c2381f02bce999f8b310e8a895043","observation_id":"6d2b3236-2cc7-4962-a37f-f3d3f52ed4e9","resolution":{"observed_at":"2026-05-11T04:48:26.625358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:7158565e9e25c5e25adb6e13569343a09dda7f8369e5f498d0c1652b528141fc","observation_id":"50bb9f86-3afe-4d1d-9b76-aea2ab1ed454","resolution":{"observed_at":"2026-05-16T09:42:12.674341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fca132a3-9c20-4e7b-934e-0a7b7f8557f9","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:f25955c28f97481a3cb532bd605953b65e0a7265356ef46582639d9b86e12787","observation_id":"f180e9f8-0e01-4774-891a-c5d27eb118ff","resolution":{"observed_at":"2026-05-11T04:48:27.346351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:989e88e86e2993cbb5d33df45e3de41201a91c080eee5f114d70c936a37983a9","observation_id":"2cd634ac-3e27-48dd-8d39-c6843befde26","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:89041345011379dbb2d1113cd8ddadf617603242203654815f6eb905bba7f056","observation_id":"13e17e04-725d-47c8-af5e-d63814117f46","resolution":{"observed_at":"2026-05-11T04:48:26.707521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b26ddbf1-fcc5-4d89-b335-902a88481ce3","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:94a16ed62066b12b8322dd0e55c527af6a9baf63a2166f28d13481e6167fbe8c","observation_id":"01ba4a1b-7329-4088-ae27-c3d4ce0475f2","resolution":{"observed_at":"2026-05-11T04:48:27.375785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:f24bc82474a817da806a8d04f001ca79cce31547542d40339029905a7689a5d4","observation_id":"12c0ffd9-cdca-4e23-9fc7-c72bae045066","resolution":{"observed_at":"2026-05-11T04:48:26.728015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:bdaee196940d37b6acb09b491f5040c895aab1ac57dddfbf2b0de12736c912a1","observation_id":"7095c77d-5117-459b-ac10-881acf5f2746","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d94c30cf-3577-476d-8799-f04d24a578bd","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:b8d12ac2b80eaab2a26ee7aaa7b6799585542bf56343e69bae687e4e159830e6","observation_id":"11e6216c-b098-4349-99e9-4960ddd5230c","resolution":{"observed_at":"2026-05-11T04:48:27.406264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:5a6cc278b45cfcb5b2605b8d60ba54240c4465b63107d2d362bb80689bc48129","observation_id":"730bd810-dbe5-4bf2-99fe-2bc6d8e27692","resolution":{"observed_at":"2026-05-11T08:08:10.048088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a809dcd7-981b-4f11-a620-994e6dfb3a59","year":2022},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:4fd9554a206ecb3bf8ccb9a6ac5f1c8377c29c2e6e5820f733dc3b2f12365c6d","observation_id":"806904d4-06b1-4e3b-b08b-0a7c71fad7bb","resolution":{"observed_at":"2026-05-11T04:48:27.418528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a8be1de8-6bf4-48f2-86aa-a7b00cde35ca","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:9642755e8b8305de32b21e4b7842bb2eecfabe433d66066294f0b26cfee07490","observation_id":"6d70cd75-b56c-411b-be2f-2fb4c992aef5","resolution":{"observed_at":"2026-05-11T04:48:27.430669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:7a39d82a0eb6389b184619b32fc8e77a2e48cfd35da446080a6960a6b0852c2c","observation_id":"31960e2f-eab4-4db4-a130-b6b293d6ee4e","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:1ffdbf5bfbcdc093189e58c10a1d5b893e3a9e444ed7e99c477fc0ab7b6ca59c","observation_id":"55341280-c5b0-4020-bcc2-8295d0970e8e","resolution":{"observed_at":"2026-05-11T04:48:26.783532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-07-06T17:20:11.913242Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":"2401.13919","doi":"10.48550/arxiv.2401.13919","metadata_source":"pith","pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","venue":"cs.CL","work_id":"12c1d840-af20-4a4e-8750-6b9c6266638f","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:46496d36f739e9d73d477e29943a0f8a623d3af8dee2d6f6436deb24a4256f7e","observation_id":"64f82a00-3b07-4bab-a1c4-79c8507edf7e","resolution":{"observed_at":"2026-05-15T22:43:35.479641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hong*, Y","venue":null,"work_id":"f0a9ef3f-263e-4513-9a18-bc074f1f4ee6","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:69ce4973e1fb899a37ca77a25c2ea4e9dd411b843a68bbdea73ba4e217c33048","observation_id":"1d0cbc65-7340-4f17-b5f0-116809f90350","resolution":{"observed_at":"2026-05-11T04:48:27.459608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:18fbcce7a2aef9542f34f742eb26c48ddc9172dc21aef90bcb40a43636bec627","observation_id":"c18bd244-ec45-4b50-8fdd-e5e641b6b1d3","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"135aaf4e-b4d0-451b-83f7-0dab81d98984","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:3564fd3fbbf2dbd2d80459415cf458621b4a31c5da2b9717304a4e22476e1663","observation_id":"8f84ff08-b70d-4ef6-832e-dd9cf65f9e5e","resolution":{"observed_at":"2026-05-11T04:48:27.476858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b84beab1-c5a6-46ee-968a-00d739d0288d","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:f36cf2855445cd3ebb89f4b56801e016517cceef5ff8b2355c96ac52f9f7943c","observation_id":"efe7b67b-80d4-4485-a868-b065ed9921bb","resolution":{"observed_at":"2026-05-11T04:48:27.481408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:a2bf484471277d1f63293a60d0a1daed282a122ba374d5bec75c233cd2cdf19b","observation_id":"9de0b98c-a221-4670-9e94-57be5e67862a","resolution":{"observed_at":"2026-05-11T04:48:26.835382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03135","doi":"10.48550/arxiv.2506.03135","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":null,"work_id":"f971b57a-47ff-414d-80f9-50ccac0c8e78","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:a632297522727c91496769ee426081117c34b009ad6dfecaa8fe6b06d8e71d1c","observation_id":"b1d80984-08e1-4888-a774-275d110f7f57","resolution":{"observed_at":"2026-05-11T04:48:26.845811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kazemzadeh, V","venue":null,"work_id":"567294e1-24b7-4568-bffa-0021532603bb","year":2014},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:2147cbe1fc70bb6528ba0b5bf48c82109f81c007af25b3dae7979bbfe0b9079c","observation_id":"32557da0-c972-449a-85bf-8ed1c30ca02b","resolution":{"observed_at":"2026-05-11T04:48:27.503174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kembhavi, M","venue":null,"work_id":"d19dc417-9a93-4017-bb56-f307eb0119e3","year":2016},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:2a9556926940b6d428b43159031365a0065bb06972974142b52b857272a37673","observation_id":"993f66ea-087e-4945-bf97-538b2cd6099a","resolution":{"observed_at":"2026-05-11T04:48:27.507506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"59e1a887-ec6b-4956-aea6-e16d076843a1","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:8b702596ae6348e2f6b50a096d774a39b26894ab28c955f426a889791e6f8f2f","observation_id":"cbf6d70e-2a8d-42e5-9e97-42948754d08d","resolution":{"observed_at":"2026-05-11T04:48:27.518542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"37e3bcc1-5b43-425f-a880-c2fac355ec99","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:a9e339a170c835e57576727177d114fd7ad34ea8019929789aa0c6def9ff6278","observation_id":"40cb6362-eb21-4cc3-9d62-be85682f8d94","resolution":{"observed_at":"2026-05-11T04:48:27.522931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08418","last_updated":"2024-07-12T08:54:51Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:01:04Z","title":"OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":"2406.08418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08418","snapshot_observed_at":"2026-07-03T17:18:43.867707Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":"7d9f48da-319d-4a13-8604-4f435eb9c224","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2406.08418","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:286ff5593ec583c021b3da65739703861808c2c6a50eaa0449c9941701103f6c","observation_id":"43d12450-2c33-4b38-841a-93432052401f","resolution":{"observed_at":"2026-05-11T04:48:26.861808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:7e18b3614469e6a85b991ecd0be216d1fa2cf2275fbd7ec932e8da3cb6c13170","observation_id":"eb8a6873-00c2-44a1-ac9a-d943b31a1ae2","resolution":{"observed_at":"2026-05-12T17:20:54.147488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a603fd33-a277-4312-b117-3e22093ed356","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:e670ff3ea57b3a78f519ca5559c23fafaab942a33b311bf7703c4428d105717b","observation_id":"89b20bb9-f45e-416d-937f-80a89890e796","resolution":{"observed_at":"2026-05-11T04:48:27.558472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:76ed6e9edd91bc3d17dd4a6f2abf5d9cea2cb65c55e1b994836b6c047f9dd07d","observation_id":"1cb2b56c-d296-4890-b665-1d6162ec25f1","resolution":{"observed_at":"2026-05-11T04:48:26.890437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"57c8277b-56ed-474b-b4e2-3bbc1784f299","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:ed63afa4cb1d504316133cb888703b9b82f7a2fceb54741d33496fd49e0237aa","observation_id":"a4b5b0b0-401f-4f6b-af39-858f318d383e","resolution":{"observed_at":"2026-05-11T04:48:27.576258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08aaef48-e476-4d38-8ec7-1450f6f27fc5","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:3443cae1772ab6053e96c7d27dd4a8c0e2043a8ab084207fb684f7f16aa219d8","observation_id":"38a407fc-7add-4f1b-ba85-90824b936f1c","resolution":{"observed_at":"2026-05-11T04:48:27.579852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masry, M","venue":null,"work_id":"0d84c959-8d88-48a7-a0a6-3c1ce21120d0","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:1d65579546c4190dfd7393d28170ed1c5ab6945498962edf3199cafd6d60f259","observation_id":"431ac938-5fb6-42e3-9524-b12e1ed4f750","resolution":{"observed_at":"2026-05-11T04:48:27.588986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d87f6907-cfb4-4bc4-a51e-ec07fd3703f1","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:d644d4521dbfdd0adcee8f9edcb483b28ed08707922b9ad2bbf98ec87b0b8ef5","observation_id":"d6a31d02-7dc9-4414-afa3-02e917d7b4da","resolution":{"observed_at":"2026-05-11T04:48:27.593197Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:c6c004ad664494044be40b23f998dbcd473df5add2e6f85401f5fc9a6ce17ec9","observation_id":"c46b98c3-879b-4007-8a46-c206711c38d9","resolution":{"observed_at":"2026-05-16T21:55:41.398838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":"2405.14573","doi":"10.48550/arxiv.2405.14573","metadata_source":"pith","pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":"cs.AI","work_id":"c5116d19-d3d3-40fd-9620-f7489812a9ba","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:0f6c15f892d7146f87ab9fa2553bcc1e706bcbaf0fb56d2eb71b6bc2761ec049","observation_id":"2423f61a-8242-4915-9692-a1e5fe5c5259","resolution":{"observed_at":"2026-05-13T12:06:13.928391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-07-10T23:18:15.002009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:20ed1a0b1528b61439e3e3f0d415ec3da13249a7b8d6c870d48c486224e408e1","observation_id":"72ce693f-81b5-4041-8af2-6027aa1b2613","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schuhmann, R","venue":null,"work_id":"d1cab726-8391-429c-94a9-f2fe10438e9f","year":2022},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:bc66f3f7df45e5fc52b21d8c901db3fdc8606d00f58bd6d54af7d944fdc86bc1","observation_id":"d92aa059-df7b-4b4a-8fe9-d8e4fd31c8ce","resolution":{"observed_at":"2026-05-11T04:48:27.304629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:4794b41cdf38ff034ec3566ae215e53a759f890767bf2512f83a2e352585338a","observation_id":"349ccc8e-5008-48bf-8d04-fdc34e30e3e7","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:fd4e37ab64dbc959bbe96d6b8d1c351ceb1e93abc37358c91d30016adc09ac63","observation_id":"74767c3a-3163-48f9-aa61-6eb3787ed9fa","resolution":{"observed_at":"2026-05-11T04:48:26.951495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"051893e8-22ca-442f-9a1c-14229430292b","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:0ac18228f6a575646ddb24b23ed81a2f476aaeb1097e90cbba1f8ef341e68ca3","observation_id":"ee73d3ff-7448-4b1f-9069-8da0443b4962","resolution":{"observed_at":"2026-05-11T04:48:27.369166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-07-11T01:27:45.562618Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:c60fc7403da22d0e578aa2d64cc02e92f0b2d3b2b538514b286905f1201729f3","observation_id":"78859dd4-c892-47c9-84f7-1899d66dd444","resolution":{"observed_at":"2026-05-11T04:48:26.970102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartmuseum: Testing visual reasoning capabilities of large vision-language models","venue":null,"work_id":"5ba7d7b5-92b0-4974-b704-550b86b1a50e","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:a8039458812b92c744b205d80064f35f7b6a0a0f3a92535d71bed3c513bb4400","observation_id":"51038012-181e-4453-988b-970b0d93333a","resolution":{"observed_at":"2026-05-11T04:48:26.985869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa078996-fa7c-4182-a89e-3ed760da5015","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:3e32b72c99e8d701f96b00cbf51e193603b3fe31814f05a356e576b942b16044","observation_id":"6d2f40ed-dc13-4a01-8020-8e3dccc62377","resolution":{"observed_at":"2026-05-11T04:48:27.411372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a702b737-faea-4a54-b568-4ed9b2a33255","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:4f675d95ec9672e7d26807215d9623fa9ccf75cfd6a034e52f76844fdf0bb333","observation_id":"09574fcb-d1d6-40e7-ac81-d4a098481613","resolution":{"observed_at":"2026-05-11T04:48:27.438756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:e96bab64b5f1babde646f38d462409216b5323f4e487456a07f5a0871c10c008","observation_id":"d8f5720a-9f83-41fc-bf08-1a70ebf61992","resolution":{"observed_at":"2026-05-11T04:48:27.005806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-07-30T09:08:14.292863Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-10T23:07:47.582320Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:39285eca043ab3ec41ee77e6ade3ff857e11e39d5ec14ee7804aa3a50df33a99","observation_id":"bf6c33c7-b45b-4f61-80c0-78a734d9e414","resolution":{"observed_at":"2026-05-11T15:30:26.569831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c0d9007-abc1-4371-9a56-21a0cfe26af9","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:666350494303726a126cf5e75349090fa79217e3da8b24be7a68593d2e6df00c","observation_id":"3a040154-0e21-4640-9cb5-e8dd365ed4c4","resolution":{"observed_at":"2026-05-11T04:48:27.470462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ba034911-508a-4ee3-a614-7e19966d0b35","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:92906a44161e2e4030385c6d3daec8bd7b847ac5924cf00863325e37c8c096b6","observation_id":"950f6f15-60c6-459c-bbf0-058c428440c0","resolution":{"observed_at":"2026-05-11T04:48:27.487978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.19427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:57:51.403461Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding","venue":null,"work_id":"d7a679b9-43e8-471f-886d-74df09e8fab3","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:6c8304862298308265019419b58f6392a496953cfb9cedd19e47d2125dae0c59","observation_id":"16ebb76e-e919-452b-bb33-3967c54d334d","resolution":{"observed_at":"2026-05-11T04:48:27.026664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-07-31T00:37:59.390090Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":"2406.09411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-07-04T21:00:08.872451Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","venue":"cs.CV","work_id":"9303f540-1c57-4c25-bed8-4456eb1c7e17","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:54378a4a6450dd47ccb83431619ce8d8f5233db8a3485647db6de14430655d9d","observation_id":"296e7026-5aaf-438a-899a-bce379d37712","resolution":{"observed_at":"2026-05-17T01:09:30.603679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:56:19.223793Z","title":"Traceable evidence enhanced visual grounded reasoning: Evaluation and methodology","venue":null,"work_id":"52502faa-f204-439c-81a1-8e82675558f6","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:3faff15fd92631d8583a74e587c0ff80bb59358c337058e5fb088f14da355860","observation_id":"0d602a1f-e0d8-4649-9d56-a6cf1bae3443","resolution":{"observed_at":"2026-05-11T04:48:27.050964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:a7772b381af8ea1f3fd6599cdc6a19a97c93268539043ff2d7a73dbd6b8b2d7e","observation_id":"85460c8a-acfa-42a0-8744-dac368308d64","resolution":{"observed_at":"2026-05-17T20:45:37.909362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9adde96-f043-4e05-a338-c07e67271dda","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:b2cc58da928f6bb9c0fd67b7a691b28c51b92c4078a8f77be88cc6000e1bddd5","observation_id":"db32267a-c286-446c-9c0b-b04c51edd6cb","resolution":{"observed_at":"2026-05-11T04:48:27.601349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:650dfd95169eecb2fd912ac0b32d6a295eeb3ac6dd3acd9fe5a3b908feaf5d7b","observation_id":"9f40eb1e-658c-46e0-b9de-4a42237d515e","resolution":{"observed_at":"2026-05-11T04:48:27.083792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2406.08035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-07-04T16:09:57.146670Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","venue":"cs.CV","work_id":"e9bfdf40-cd28-4d57-98b8-31b7e97f9f2f","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:f1c3fa61208ca9e5499f30cf1897cab2f4e2232b414b6ed38d20dbcae20a1f5c","observation_id":"1a53ad19-5d81-47b2-ac86-96d4e2691dd5","resolution":{"observed_at":"2026-05-19T11:55:30.239348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:18a0583fba91e0de5747759be19ac0d877a831f02cbd575a5045c01c3c24c9fb","observation_id":"5a1fbefe-20b0-4d5f-8a13-5f05abbdd271","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ac21ac6d-65ef-4006-9133-3f9ceeeb85b9","year":2022},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:0d2db53e2bdfd634cf35cfa2ca90d9a4577677ce268694528f889b3ca871e34c","observation_id":"4839ca8d-2669-4a28-9ef6-f690340e6c32","resolution":{"observed_at":"2026-05-11T04:48:27.364215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d5d5ba4-6c11-4759-a868-96034f7e8892","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:cb3f127e16fc5c94789aedbfb627f82944a5359f5689fc93b19eaaa275800af6","observation_id":"47da3101-6565-451c-a7f4-477a369b6024","resolution":{"observed_at":"2026-05-11T04:48:27.384381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"348a8260-f077-4ae3-acf9-58ce8c87183d","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:be64888040d9a8f559838f47ecb4410be1f852c1b798f8d848c17054247a85b4","observation_id":"fb1afeb4-99da-4d24-9b96-30288b2de71b","resolution":{"observed_at":"2026-05-11T04:48:27.395274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":"2309.16671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-07-04T20:50:12.667951Z","title":"Demystifying CLIP Data","venue":"cs.CV","work_id":"7af932a5-c6d2-4f55-9522-7777cc3fa5ae","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:c753d3438d51ddd248de5a37e03480079276d19a8e7fd3612d2562c0407ecadc","observation_id":"c2ca68de-de23-40c9-bf90-4f0d83d30cf3","resolution":{"observed_at":"2026-05-16T09:20:20.637207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-07-06T21:20:55.836867Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"cited_work":{"arxiv_id":"2505.05315","doi":"10.48550/arxiv.2505.05315","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05315","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Scalable chain of thoughts via elastic reasoning","venue":null,"work_id":"1e2bf4fc-ab8e-4269-8583-baf9ac491d2d","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2505.05315","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:9b342c87320569a99448ac4770fc76a515e2c0d9d6b3c9735a9e9493607f9ece","observation_id":"06fce0de-9d53-4c7f-9090-1838a236a2ae","resolution":{"observed_at":"2026-05-11T04:48:27.153354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15280","last_updated":"2025-04-27T00:11:00Z","snapshot_observed_at":"2026-07-06T21:12:37.115803Z","submitted_at":"2025-04-21T17:59:53Z","title":"Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":"2504.15280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15280","snapshot_observed_at":"2026-07-04T21:00:08.852868Z","title":"Seeing from another perspective: Evaluating multi-view understanding in mllms","venue":null,"work_id":"4411807c-24cb-49e0-a821-eac51976375f","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2504.15280","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:1cbfd6b601cef6c55228323e86d375d4e17719a4398fe906ee6e4324ea519e15","observation_id":"7e952fe8-0505-4b58-9ece-17e1b33c6bed","resolution":{"observed_at":"2026-05-11T04:48:27.186831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:2cfbdf26b3085c30540e700290ebc1fd62c1af062e11ea4d4f92a5515a9f75e9","observation_id":"a3d504d5-3782-45a7-81fd-467558ba43c8","resolution":{"observed_at":"2026-05-11T04:48:27.221885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a95e0dae-007e-45c5-98de-56c91a106d19","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:4aaef1c782cc2d5d02228823076b318adaa122d17b75fb0280df8657e0394d81","observation_id":"5911b8df-ebd2-4ba7-82d1-5d46a91ce7e9","resolution":{"observed_at":"2026-05-11T04:48:27.549350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:ef8d1c37ae9b1e40f427b9a3301611c7a10b7a24d0a6c9d9e19c07e40de165dc","observation_id":"3964833b-e941-4864-abbe-307ba3d5b5ae","resolution":{"observed_at":"2026-05-14T00:51:48.633687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, P","venue":null,"work_id":"02e2a55b-9c53-476e-835b-6147ba0a5254","year":2022},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:515bdf32a38a412dc1d51eaa507b550f3a49a00e2ef86b573f0e279755b9fba7","observation_id":"665bbba4-4de0-4785-b757-3c8c2f9fc193","resolution":{"observed_at":"2026-05-11T04:48:27.606139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, D","venue":null,"work_id":"9f5a15bb-b059-472f-b012-485c1da9394f","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:d58e241b0864bb71e5c6326e3854c91afdbfd617ba7e64239d066d02ed4a03bc","observation_id":"28db0541-c2dc-49fd-b387-434d2552bbbd","resolution":{"observed_at":"2026-05-11T04:48:27.611199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75404b89-4376-4a15-9fcc-18456cdc8153","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:f3065eb4638c86de34424b1461168e63412badb884458d4f418125621a115a97","observation_id":"98d3a9b8-cef1-42f2-b348-c6ea1ea19948","resolution":{"observed_at":"2026-05-11T04:48:27.445538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T03:17:51.831519Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:077a514adfff925a309f41dabe7d2fbedd7b082cc42208549d137555cf90d64a","observation_id":"22a1f710-e07d-4141-9ec1-bdb9ba20c755","resolution":{"observed_at":"2026-05-11T04:48:27.253853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a87058e-bf60-4b60-bcfb-87fdd85538ae","year":2023},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:2e0f2d56844a343fc1e92590844dfd99f34dc77c5be4389ad106759425c7f6bd","observation_id":"e316bcbd-79bc-441a-9d9f-fd54c260487d","resolution":{"observed_at":"2026-05-11T04:48:27.496253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":"2411.00836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-07-03T20:48:56.041994Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":"1b71954f-ae5f-4a76-9175-6e677f7b4c85","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:bbcd8f1284e790d9f4b587b4429a4b26b9999d25b05f4815e369089a986374d6","observation_id":"b7f21d7b-1304-4d8e-aa23-099a7a46970d","resolution":{"observed_at":"2026-05-11T04:48:27.265524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"毛细管”。 当左右两个装有不同颜色液体的杯子与中间的空杯之间用纸巾连接时，纸巾会利用自身吸水性和纤维间的毛细作 用，将左侧红色液体和右侧蓝色液体通过纤维间隙输送至中间的空杯中。随着这种输送过程的进行，中间的空杯逐 渐被液体填满，从而出现了“中间水杯有水","venue":null,"work_id":"82300ae1-48f5-476d-85d7-418d0ccd77d2","year":null},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:8c8695797e24afc0da358299b1330efaa6dec44e47eacb1e1bf8d2916895ec8c","observation_id":"03b47436-6993-4564-99ed-0d555f18b7e6","resolution":{"observed_at":"2026-05-11T04:48:27.571807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meeting\" event - October 9th has a","venue":null,"work_id":"0c216f4a-950a-49fd-8863-e76a231a3921","year":null},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:79cd13dc02e403e5bf3de714b6efffa3cedb8dd0454d6d78e063903b07865f61","observation_id":"29992f48-4b91-4465-a9f7-0ce5965452ca","resolution":{"observed_at":"2026-05-11T04:48:27.452772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31e0f580-62bb-468f-9485-261d7c40b901","year":null},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:ba36636cc802e040e539fae5eb073a2e6551ba5eef892e6f313eeaee7fc839f9","observation_id":"503ed9bb-710a-49d8-bfed-7baad49ef859","resolution":{"observed_at":"2026-05-11T04:48:27.530294Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":26,"verified_exact":39,"verified_fuzzy":10},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 100 inbound Pith citation observations for arXiv:2507.01006."}