{"as_of":"2026-08-10T08:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c18bceb7347f2b4dd7a7eca9d8fe01a9e109d4d90563cc02d7cefed38f00d3f","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:41.790587Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:00:28.350003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.521253Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.19000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19000","snapshot_observed_at":"2026-07-02T17:27:15.521253Z","title":"Veripo: Cultivating long reasoning in video-llms via verifier-gudied iterative policy optimization,","venue":null,"work_id":"df0aa6dd-8de1-4eeb-a3bd-590c09808d7a","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":186,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2505.19000","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:94720db6db365fc7ee69e5b370be0bf77089b18de738dc3971434459d0625c6c","observation_id":"7f0f584d-4899-4432-99e9-981f89d29755","resolution":{"observed_at":"2026-07-02T17:27:15.522720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19000/citation-record","integrity":"/paper/2505.19000/integrity","json":"/paper/2505.19000/citation-record.json","paper":"/paper/2505.19000"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:33.753694Z","title":"Vivit: A video vision transformer, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:33.753694Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:18a6a0065930f7dea08cb7d6eed603fc9429af1e23b5df7fa0232aeeac1fdd00","observation_id":"1d7e8ef0-f616-4233-b6b8-7c5546b3fb49","resolution":{"observed_at":"2026-08-07T14:25:33.753694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:33.825918Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:33.825918Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:88e6df56a7a9d7841d18a811fb8e9b8617e538612a72f03e758fa586997aa966","observation_id":"76d4e32c-d59d-4411-b43d-484e9c0b9034","resolution":{"observed_at":"2026-08-07T14:25:33.825918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:33.894037Z","title":"Hadzic, Taran Kota, Jimming He, Cristobal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, and Fei-Fei Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:33.894037Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:6685d5691b8ac5a8eb61f4ac03440229c979e3aa6b1d4c76a33f928347267dd8","observation_id":"0961278c-cf23-4573-8a72-ec11bc76853c","resolution":{"observed_at":"2026-08-07T14:25:33.894037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:33.962297Z","title":"Mecd: Unlocking multi-event causal discovery in video reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:33.962297Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:784b63bf9393ee6329e7688a61f6808e21ad801ad7b469d83f5c9e8e61c0a2ae","observation_id":"409da519-2955-42e7-b6f6-3deb200c6084","resolution":{"observed_at":"2026-08-07T14:25:33.962297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.037141Z","title":"On the suitability of reinforcement fine-tuning to visual tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.037141Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a6236a2bda170326392159f89cf207393836ccd3352a7baff036fea07447ec14","observation_id":"e2cf40d0-030b-4afe-b70b-34471a2baf45","resolution":{"observed_at":"2026-08-07T14:25:34.037141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.112293Z","title":"Videovista-culturallingo: 360◦ horizons-bridging cultures, languages, and domains in video comprehension, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.112293Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:f9a59f334d40e6866c915e4ecc350c678d56225e2ec6a4147c7670106560c3d2","observation_id":"04afaa31-a2d4-4e3e-acfd-b8b2e62b02fa","resolution":{"observed_at":"2026-08-07T14:25:34.112293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.190497Z","title":"Visrl: Intention-driven visual perception via reinforced reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.190497Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a857d9bc1d7ce73e0bb2de0535ec36a9589703a076d66470bd639643858e454d","observation_id":"5266d1d5-e3f8-41fa-b581-b017a02346c8","resolution":{"observed_at":"2026-08-07T14:25:34.190497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.286812Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.286812Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:f6fe56a8dccb23e2228ffe1091b94635375c3eef7570f1ad75ab13a17bd0adb4","observation_id":"37bae379-aac5-41b5-906a-b7e3ccdcd4af","resolution":{"observed_at":"2026-08-07T14:25:34.286812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.362878Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.362878Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:76440644bd9ad7bf9ebc506a36e9111f5855fb5580eb421f8cf4fbeecfb0ddb8","observation_id":"b9753eec-9007-448c-9e2d-a954ce290fb3","resolution":{"observed_at":"2026-08-07T14:25:34.362878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.444821Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.444821Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:3c40f8fa9b142148330c08cb816592b59a9b7caab92b3ec69b7bd8cd18e9a0df","observation_id":"b603b5b1-3815-42a2-9a04-e5e9eb6ee7b9","resolution":{"observed_at":"2026-08-07T14:25:34.444821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.524495Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.524495Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:f88e3ea0ed7c4ca122d4f53b9f262113592293db3748bb21daa0da0a3d3b3af5","observation_id":"6b4c2fd8-0f4c-4296-8aa9-21ea56e7bcc9","resolution":{"observed_at":"2026-08-07T14:25:34.524495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.598577Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.598577Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:cc8d3c4b29727a5dba124b31ab6f0644f7099009a6a0b9c20e266e433bb96d04","observation_id":"5ee485d6-b41d-423c-ba79-8f6a363217c0","resolution":{"observed_at":"2026-08-07T14:25:34.598577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.672404Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.672404Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:6e76ede72b23ede8a8ea813da2aeeff34f1e2ada6ba61e004b3e4001d8799055","observation_id":"3c6f3ce1-2ded-4a01-acd7-42caf7e37e5d","resolution":{"observed_at":"2026-08-07T14:25:34.672404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.746770Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.746770Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:8fe7a02d88ca7ee35cccf604301a792fa8965900a3b18b9d127fad9fd9fd7e01","observation_id":"1d556e72-8013-424b-a2f7-f47a33501972","resolution":{"observed_at":"2026-08-07T14:25:34.746770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.820578Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.820578Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:d0c889a0c7c00db1cc491344587019931f7c422f63fa5f76959c4972c74fc193","observation_id":"3951efe9-2156-475d-b43b-2fae23be11df","resolution":{"observed_at":"2026-08-07T14:25:34.820578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.899833Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.899833Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:12eb13479172bb1005ab30f0cb98c2750703f981ebd884782e829c5789b1cc14","observation_id":"045a8a13-2a17-4340-b703-f407c3577525","resolution":{"observed_at":"2026-08-07T14:25:34.899833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:34.948834Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:34.948834Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:3c32e44e4d3cfe183dac8084d9df50cad7d1285dddb91eb119df0d28a934ffd3","observation_id":"bb9e0ad6-7a21-4b74-8675-62abdd22a36a","resolution":{"observed_at":"2026-08-07T14:25:34.948834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:35.012190Z","title":"Video-r1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.012190Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:9835d41d09e5769bb59efb33d5c270c0a004c6445d5b6516a3973b323e9b0a6e","observation_id":"4df0315d-e9ad-40f6-a897-404bfd87ced8","resolution":{"observed_at":"2026-08-07T14:25:35.012190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:25:35.129702Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.129702Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:761c095d5518dd725b193e409e85d3bb07ad0417dbc9b285f04d68f4e77cc676","observation_id":"eefe869a-ff52-4113-b12c-7a877552bf95","resolution":{"observed_at":"2026-08-07T14:25:35.129702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.562970Z","title":"Ampo: Active multi-preference optimization, 2025","venue":null,"work_id":"0e0016aa-d087-4bbf-aa34-790887b4d801","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.229600Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:e33f5d52ce6b6009a7250526649ddac29680041f308946c9c85c9d6b8e722f5d","observation_id":"62ae0e71-efab-4eed-8c25-3071c665ac49","resolution":{"observed_at":"2026-08-07T14:25:44.568271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:35.301478Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.301478Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:077df37d9f82f12290a9cc4a53f987a40287cf2b784a0f79e3ed152ce6aee533","observation_id":"06263630-fe84-4bef-acbe-3daaedff91e5","resolution":{"observed_at":"2026-08-07T14:25:35.301478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.537072Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2025","venue":null,"work_id":"d0dc2aba-176a-42c5-b1dd-719371c06598","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.426624Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:e3b076c1c5254e9530f3e88c476e2f24de796e90f508cb37992ef246c3c8ad44","observation_id":"d6de313b-5d04-4d0e-9610-853f4aa3ec4a","resolution":{"observed_at":"2026-08-07T14:25:44.542641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:25:35.522280Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.522280Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:91ce4815edbbf52203e9a7a14144c0b6bbbcd96913ec1483325d85beb7719944","observation_id":"6c110c8a-34eb-4a67-8c7c-b71ba96b09e9","resolution":{"observed_at":"2026-08-07T14:25:35.522280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:35.624195Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.624195Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:82dbf39cde2218c001a3007d4dab0d1d7d3b600a1374aa0e953ac8b520ca8eb9","observation_id":"4f81678d-94c2-46d6-8cb3-a7c0ceb43465","resolution":{"observed_at":"2026-08-07T14:25:35.624195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.508280Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections, 2022","venue":null,"work_id":"d0f32aa0-9baf-4616-9242-f42b66a2b295","year":2022},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.702600Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:74a9a46d5ce5377fca1fd17d415b346cc1a622bf5355e47bbd9fff9a7450e768","observation_id":"47f11427-e3c6-4d4e-b5f8-320f644cef56","resolution":{"observed_at":"2026-08-07T14:25:44.514345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:35.785498Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.785498Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:0e66785c457e7d824c10b8666863583281628d064ed3c6f099a8acb61238f40f","observation_id":"694d051c-050d-4572-a1b7-d061a7db60cb","resolution":{"observed_at":"2026-08-07T14:25:35.785498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:35.876567Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.876567Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:9f891563612a890bf7c206546e547d9665acf15cdb077d6ac90f9186599a2420","observation_id":"28608a34-9347-49bc-8472-e0d4921349ce","resolution":{"observed_at":"2026-08-07T14:25:35.876567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.470573Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning, 2025","venue":null,"work_id":"24a7460e-77ab-482a-a489-ffb181a9b2e7","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:35.985818Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:1080408ef3befeabe280397b49f587fe25365ac6a1e80269d8765ea91566cce7","observation_id":"2606f9a0-c124-4410-befb-498f6dd6566e","resolution":{"observed_at":"2026-08-07T14:25:44.475598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.452450Z","title":"Lmeye: An interactive perception network for large language models","venue":null,"work_id":"6f888260-1eeb-4390-9b8d-863445807046","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.059418Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:0ce0e310b16e59df834530952533ab663c6249f5a5e100054f8d5193ca09b2cb","observation_id":"ca29190a-592f-4596-bf5c-8469b8adeb75","resolution":{"observed_at":"2026-08-07T14:25:44.458668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.434076Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts","venue":null,"work_id":"61a6673d-6e1a-4030-8730-1c17f89b711c","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.131342Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:93a3b2b81706d9fb7f111c1195fc6c58d945f8dfde671caebf1980de8fa64325","observation_id":"36f6cafb-21df-4428-85ea-3a801d322d36","resolution":{"observed_at":"2026-08-07T14:25:44.439968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-07T15:49:03.741523Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T14:25:36.210901Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.210901Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:93980dbf19dd223ef54c856c7d900660ba430ed727ea2c50374342a1797e35fb","observation_id":"5564ec1e-1a3c-4ca7-9f33-586185119adb","resolution":{"observed_at":"2026-08-07T14:25:36.210901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23765","last_updated":"2025-07-17T03:46:15Z","snapshot_observed_at":"2026-08-07T16:26:03.329437Z","submitted_at":"2025-03-31T06:30:35Z","title":"STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23765","snapshot_observed_at":"2026-08-07T14:25:36.284175Z","title":"Sti- bench: Are mllms ready for precise spatial-temporal world understanding? arXiv preprint arXiv:2503.23765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.284175Z"},"links":{"cited_paper":"/paper/2503.23765","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:0e13df64a12699f6f0379f91552ec73e7411c9bbdb842a83f2c8b39e84af4b75","observation_id":"41962da8-18cf-4446-99e1-a953da3e28de","resolution":{"observed_at":"2026-08-07T14:25:36.284175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.414848Z","title":"Vila: On pre-training for visual language models, 2024","venue":null,"work_id":"98d850ec-0547-4c6b-9033-f18dcce52181","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.381623Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a15df44fba70862fba833f6330c798c1b6bd77c230c5cad96c20dfb58cd144d6","observation_id":"c074983b-78b9-48a4-85ae-111466a8ce31","resolution":{"observed_at":"2026-08-07T14:25:44.420911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.394884Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning, 2025","venue":null,"work_id":"361d7b83-402b-435f-b19c-c8c40023a9c4","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.433148Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:171fa4fdc7692dec0db9c7a73ce823334c853f13b9e1f19c7e9cf5d0d81046ea","observation_id":"9c71c0c2-5ca9-4ed6-82d6-f067018ce985","resolution":{"observed_at":"2026-08-07T14:25:44.401740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T14:25:36.477596Z","title":"Tempcompass: Do video llms really understand videos? arXiv preprint arXiv: 2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.477596Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:74804c844fd4384c3fadcea27f90d46cc60af619fd4eaccf89d7137f46472fb9","observation_id":"7ed38859-3287-459d-b6bc-99df5e5c01e4","resolution":{"observed_at":"2026-08-07T14:25:36.477596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.374913Z","title":"Videomind: A chain-of-lora agent for long video reasoning, 2025","venue":null,"work_id":"98d73492-6c2a-45b5-b4cc-ce73d962713d","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.570295Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:31d8e65b45fc798ec94e687e4ac5e31a759a6df39c43e9ae7e4d0315523588d8","observation_id":"7a487b60-f8b8-41db-9bdb-01b659bc5e59","resolution":{"observed_at":"2026-08-07T14:25:44.380424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.356513Z","title":"Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement, 2025","venue":null,"work_id":"ca1facdf-670b-4827-b608-6cf34fc3b6cb","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.627352Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a67087649ce82cb421dcccc9007dea11b42da2a2455ec20f14db209585138e9b","observation_id":"13772a12-cafc-4c28-8b44-6cbb865b1596","resolution":{"observed_at":"2026-08-07T14:25:44.362075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.335201Z","title":"Video swin transformer, 2021","venue":null,"work_id":"332b852a-23e2-46f5-b343-e79b37710383","year":2021},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.678713Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:2f9f6d53aa9bf67961b3c3eccc4c309f3c7029fcfc0e769e6dee5eb044449eaf","observation_id":"5eeef245-9d51-4420-a4cd-79593a5113c5","resolution":{"observed_at":"2026-08-07T14:25:44.341147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:36.726888Z","title":"Visual-rft: Visual reinforcement fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.726888Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:11be4b8f6c65506a3abfb82f3ce666282add41dc0278343cee104cb09885c408","observation_id":"5a8ded3c-ef20-4f05-bd47-5f30ccd8638e","resolution":{"observed_at":"2026-08-07T14:25:36.726888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.304386Z","title":"Othink- mr1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning, 2025","venue":null,"work_id":"8c3c8e08-aaf3-455b-8e6d-deb6c1187a90","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.822010Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:5a179bec175a4c9828644fd76f94502a33a67c07bce12ed3766ef49c8c1a727e","observation_id":"5f3e6f78-c2a0-48b0-bc17-8dd518d17540","resolution":{"observed_at":"2026-08-07T14:25:44.311845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.287966Z","title":"Gui-r1 : A generalist r1-style vision-language action model for gui agents, 2025","venue":null,"work_id":"7ce94ce1-b23f-4699-b825-19487f913065","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.900953Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:600c1e1a96b9f6503f2583aad1abf8e7d9a6f637cb0c8df7f42b4c380d3d647f","observation_id":"20223307-5c25-4dfc-bbae-66b86c8b6fce","resolution":{"observed_at":"2026-08-07T14:25:44.293008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:36.947665Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.947665Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:0dd57df5da20fd61260ffe7709fa013adc0488dbf3ffcefc865e3a679cde3feb","observation_id":"a6cce647-dddc-463f-b3e6-9ef9099aa604","resolution":{"observed_at":"2026-08-07T14:25:36.947665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:36.992181Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.992181Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:de6b95f8bdfd20485e7b7c4fa26a0bdf4d9b3f1b3548a1535e2980857c14d4f5","observation_id":"5e152623-b3b3-4979-8f71-49db77abb6f1","resolution":{"observed_at":"2026-08-07T14:25:36.992181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.251273Z","title":"Video transformer network, 2021","venue":null,"work_id":"6833fda8-2be6-4ec8-a6bc-e3f9d146d055","year":2021},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.087623Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:c3f67543c811412f1506f689a9b1b2a13ac67e22d089600b38efdfaf294a6214","observation_id":"b4fe77fa-5fdc-4ef2-a39f-24ec1e725581","resolution":{"observed_at":"2026-08-07T14:25:44.256306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.161812Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.161812Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:dad93babe9aeacd0a4aa51e9fdc9f666836c8985601329f53a089d49ff751e4c","observation_id":"2e798a55-98d7-456b-91d9-1a14b0132818","resolution":{"observed_at":"2026-08-07T14:25:37.161812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.224456Z","title":"Spatial-r1: Enhancing mllms in video spatial reasoning, 2025","venue":null,"work_id":"8845db3c-19ee-4067-a02e-7495dd611012","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.218409Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:b2d386adfef925e5a72d1ea62a1b3bb8eb566fbe886fcac64c448d829f0a177d","observation_id":"16920c04-7cd3-4975-90fb-6ea98b4cf632","resolution":{"observed_at":"2026-08-07T14:25:44.229929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.206861Z","title":null,"venue":null,"work_id":"876f0fc4-5738-4b7f-a41e-304ebf7f463c","year":2022},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.291636Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:4e7ed205d5e051cc0a70db30aca06d982f5152bc96f252f5ce6e3c48c6858059","observation_id":"5ba9fb0b-7020-4977-acc0-70fdc2ecbb05","resolution":{"observed_at":"2026-08-07T14:25:44.212313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.358642Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.358642Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:e27f520cb813c46dacd5af8c8b55592aaa72238d76ef9114fb6733632c61924f","observation_id":"274d75a4-99c2-4fae-b82f-8c8ea323620a","resolution":{"observed_at":"2026-08-07T14:25:37.358642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.441654Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.441654Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:43cbbf847780ca4fd3cdbb589a7d8dedabdfcfd198c307f9f67183476b9195ff","observation_id":"6ae60161-9a1d-4baf-983b-5b9857f9dbec","resolution":{"observed_at":"2026-08-07T14:25:37.441654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.508376Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.508376Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:11edbe122fcfba936dbea5d538cd4f2a2795f402dace27c2897fdc9cded0c316","observation_id":"d41aa557-de70-43b5-9dc6-904fbcf18037","resolution":{"observed_at":"2026-08-07T14:25:37.508376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.159277Z","title":"Plummer, Ranjay Krishna, Kuo-Hao Zeng, and Kate Saenko","venue":null,"work_id":"a02e4569-a644-4802-a2df-2f83d3bdfbd7","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.578740Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:efb49ffc1ff5b8fcbf505aeb02838479e5f77823ef834c6db3c8e3e9dab1b645","observation_id":"20d7cbe9-da84-4ea7-bb10-c5d45ff3169c","resolution":{"observed_at":"2026-08-07T14:25:44.164453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.624830Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.624830Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:9b90190deab50ad781158aaf2b0e0d0cef723dd48fca31d73ec9a06f73624857","observation_id":"2ac9b6b0-24dd-445c-bd92-afbc4ea05eae","resolution":{"observed_at":"2026-08-07T14:25:37.624830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.132310Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models, 2024","venue":null,"work_id":"881ff947-0aee-42b6-84be-c2c940edb55c","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.677996Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:84c000c261d99aa0f4cab11017d35d063ca0ee6f1a0bac4458b8afd72793a194","observation_id":"37d9daa0-a665-4770-9ce8-60933f1e9014","resolution":{"observed_at":"2026-08-07T14:25:44.137898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.777362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.777362Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:4a365fbdd6d8a5347f6c1a2f0fdd93eeb7f33e0ecb0a2aec6304b1754b697171","observation_id":"f98fa328-6db1-4d87-9835-ddb4c4c3bf3f","resolution":{"observed_at":"2026-08-07T14:25:37.777362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:37.839585Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.839585Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:c3412d97fbb8d6fc8285ff453081fc04be95962a7e49b83db8605f391fa4a4e5","observation_id":"31de27d0-f23a-4a18-bda0-eaba13153a2c","resolution":{"observed_at":"2026-08-07T14:25:37.839585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.094380Z","title":"Mm-verify: Enhancing multimodal reasoning with chain-of-thought verification, 2025","venue":null,"work_id":"68999eca-bc3b-4b99-a921-66ce3c3db727","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.907304Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:bea8a9a9808ece563ea0dabb9a3f4f774a77cc757d9d410cf08bab25a530f5cc","observation_id":"2b28d21e-c5ed-4f3f-b71e-5b423f72ca50","resolution":{"observed_at":"2026-08-07T14:25:44.100649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.076596Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning, 2025","venue":null,"work_id":"ea7fe30c-3bb5-48f5-89b6-bc4f36f2d75b","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:37.979083Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:57f01d435372b2a7f3cdae4520d70079377c39fde265489ca15233039e1b7e93","observation_id":"c7cc9cbe-8314-4493-aaf9-6f00923459ea","resolution":{"observed_at":"2026-08-07T14:25:44.082649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.059903Z","title":"Game-theoretic regularized self-play alignment of large language models, 2025","venue":null,"work_id":"5a14a9ce-987f-4e4b-83d9-ed7db872af47","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.070074Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:07ac919dcf63332aa0660938a609b7a8dc6c339d9e9ab52a4c2a1922a44b674e","observation_id":"d3d5cbb0-b7a8-462e-8de6-9ae7dfdde0bd","resolution":{"observed_at":"2026-08-07T14:25:44.065611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.041689Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context, 2024","venue":null,"work_id":"a528f6bd-e5bd-4052-8e63-4e4e278da62c","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.149756Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:b28a895dc33b8d4e9be9c9c36691a3f1f179d25baf25b2e8c2d062ba0110ac1a","observation_id":"b14dd7fb-4bb3-45f1-8dcd-927f57756db1","resolution":{"observed_at":"2026-08-07T14:25:44.047418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.025009Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":"27988c54-3d5c-4d54-b3d3-c886b00507a6","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.227195Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:e0ed79211679ac1a4c7799fab2b066dc95231fe9cc6ce930ab635a9fba6dd0a1","observation_id":"81d046a8-3033-4a98-aabe-f111467af0b0","resolution":{"observed_at":"2026-08-07T14:25:44.030350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.007646Z","title":"Kimi-vl technical report, 2025","venue":null,"work_id":"07dca1c7-6823-471d-9e9e-d1e7c3a55dc0","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.315286Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:923ed82e7769f5157f8baaf0ada735bf6521ecbae735de8b30818821fe3376a8","observation_id":"b0b7e909-c990-4a8b-a390-46ecc82fa521","resolution":{"observed_at":"2026-08-07T14:25:44.013279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.990378Z","title":"Model cards & prompt formats-llama 3.2, 2024","venue":null,"work_id":"1e70d79b-67a9-4acd-b3d8-8e62961564fc","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.408579Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a3a331bc375e79981f3fbfd0197fa92fe97b3bfd14628fb521b78ed3319969f0","observation_id":"458ec069-71a3-4c01-8b75-3725b593243a","resolution":{"observed_at":"2026-08-07T14:25:43.995469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.973148Z","title":"Vila: On pre-training for visual language models, 2024","venue":null,"work_id":"c578b5f0-ed5d-42d6-9d5b-dd264b9bb881","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.508413Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:fae071189f26de04b6fda87dabde95a15d052ccb680229fc98878fbaa52cc3a4","observation_id":"4a57df1e-44aa-491b-a32c-55f7f36a3b64","resolution":{"observed_at":"2026-08-07T14:25:43.979505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.955079Z","title":"Goucher, et al","venue":null,"work_id":"6c4f828c-cd64-4d15-9caf-ce605eeda591","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.586583Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:5ae18158b31d72da1cd1313acbcd587fef96883b42ec855ccb6268b62c5fcb54","observation_id":"56c6dde5-cc56-4c18-8bd5-efddf967b176","resolution":{"observed_at":"2026-08-07T14:25:43.961920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.938029Z","title":"Qwen3: Think deeper, act faster, April 2025","venue":null,"work_id":"c76cedd0-6f07-4562-baa5-6d88076c78f2","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.661955Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:8ac2a82df9c1a9628afb8254368310999ffef5c2acfb45a8d89c08516c3da82b","observation_id":"edf34835-998e-4cf8-85e2-4d5ff31e0076","resolution":{"observed_at":"2026-08-07T14:25:43.943223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T14:25:38.751659Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.751659Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:1d4b8fbc37c22fd49b4785f4a94a3189b705be9a3a21d42f0ce53912b165073a","observation_id":"3a4ccaf4-f190-434d-98f5-00bde03988c8","resolution":{"observed_at":"2026-08-07T14:25:38.751659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.920940Z","title":"Piecing it all together: Verifying multi-hop multimodal claims, 2024","venue":null,"work_id":"e57150d5-9a5f-40f2-914e-87644d4fa530","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.845495Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:fcf232c33a2e8976c379b2c7e3a5bb90557b550c86b7c3829cb4e8e6521f71a9","observation_id":"de1a0619-fe07-467a-b6b7-99fac19ae44e","resolution":{"observed_at":"2026-08-07T14:25:43.926036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:38.942661Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.942661Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:ef1c90d64b32b3df72a12abe3d35484c4f93ff766d54f15d8ef522e0ab57fcc7","observation_id":"df2376cd-cd36-41ec-9c1e-943cdf29682d","resolution":{"observed_at":"2026-08-07T14:25:38.942661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.893155Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement, 2025","venue":null,"work_id":"9ca368af-3f37-4ebc-950d-2530e52595b4","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.057589Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:17ce3645333afc7797744db21cfe6ae21d01635f4b771e6cc812ea675d1b985f","observation_id":"1e47208b-c819-471e-8bc0-f136c1983262","resolution":{"observed_at":"2026-08-07T14:25:43.899023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.162833Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.162833Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:0269f2f03cbce37cf4047f2989abea0c4b50b31d1af5dfde86e1f6b2539a2729","observation_id":"93bdbdc0-9ed4-437a-86c3-d2a7a9d46d85","resolution":{"observed_at":"2026-08-07T14:25:39.162833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.290885Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.290885Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:d203a7b793cddfddf73289a0c57194f6320cb181078e94608618f77fe0867597","observation_id":"1d6b0d26-3bed-48fa-be71-bbf7d253e879","resolution":{"observed_at":"2026-08-07T14:25:39.290885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.407423Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.407423Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:e6edd577840ef3c08e61d75c78a7d74b050545dde0a1582debc4525587388712","observation_id":"6cbbd6c0-91cf-4e2c-8721-c2d947882dca","resolution":{"observed_at":"2026-08-07T14:25:39.407423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.774397Z","title":"Videorope: What makes for good video rotary position embedding?, 2025","venue":null,"work_id":"282296eb-c758-4bc1-a40d-db950d747b0e","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.524418Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:7ca1052e9c4a749db931456ec7ae34c9144336234d43d1b6cb03b800d2352d0f","observation_id":"aaa784da-4c0f-4057-9298-2f5431b7b7fa","resolution":{"observed_at":"2026-08-07T14:25:43.848334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.600130Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.600130Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:78a28c87b772425706364b5916dcef2f36ce7b388f59fc1776dedf79fffa9745","observation_id":"d1d8dda5-cc5b-4249-9587-6db55b0b4828","resolution":{"observed_at":"2026-08-07T14:25:39.600130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.540297Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos, 2025","venue":null,"work_id":"75024f05-4d79-4756-b6af-df60a06e5646","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.720983Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:4a63145eb989519543c0fc8b1c4ffa200ff31f8f5c02a7fb16560730b85e03d3","observation_id":"af16f7f3-7145-4de7-aa47-b97cb4c42464","resolution":{"observed_at":"2026-08-07T14:25:43.613616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.783059Z","title":"Self-play preference optimization for language model alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.783059Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:4c86cd355356a3ec2d1b411ff89090f6731ede0fe0447de615d3b989c0e7660f","observation_id":"58361d60-a467-4c6a-84df-43188927f974","resolution":{"observed_at":"2026-08-07T14:25:39.783059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:39.828082Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.828082Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:03793df526b2ec9f1dd7d85cffcfb3ffb8a10b36261c2943aa5d7857a0ec8bf0","observation_id":"e4122e80-3584-4c60-b78a-044ff0624539","resolution":{"observed_at":"2026-08-07T14:25:39.828082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.356406Z","title":"Atomthink: A slow thinking framework for multimodal mathematical reasoning, 2024","venue":null,"work_id":"3187b888-c9f8-4c52-bd50-08ebcbbae287","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.949967Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:1ab6869fd83572c5f88275f933373201e042c12157f84f33aa36b89a2a18c566","observation_id":"887025b9-a251-40eb-892e-22deded07598","resolution":{"observed_at":"2026-08-07T14:25:43.465569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.133837Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning, 2025","venue":null,"work_id":"e41a70ff-3318-4313-934c-1522a0b7fae6","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.067849Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:260ac5377e0bfc0de9ea41697af863acfaa31364c8a9034310661cba51601141","observation_id":"7005e81d-407c-4fb1-bc4c-e4cd25d974e4","resolution":{"observed_at":"2026-08-07T14:25:43.228647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.138654Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.138654Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:35dedb6a2a8f8727f3b5b8d58a5d548b145df9f84b00adeff5029c7f4b6d2e81","observation_id":"b0a3ded2-742d-49cf-997f-23e8cd3e3487","resolution":{"observed_at":"2026-08-07T14:25:40.138654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T14:25:40.216644Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.216644Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:1efb5646a90e4fc55a8d6739214718746d5e0cbfa30babfa16faae0ba2149567","observation_id":"2f1148cd-e94b-4c22-9c6c-bc7ba63037d4","resolution":{"observed_at":"2026-08-07T14:25:40.216644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.264180Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.264180Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:69848012bf919ed02f124c526f2ad654a679d00d72f83fda7a2f9c20a7418551","observation_id":"94135652-4ba3-47a5-9413-8ca9ab4c4bbd","resolution":{"observed_at":"2026-08-07T14:25:40.264180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.339854Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.339854Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:814bd9a5e2d98be49166626ea35caf4589ed7ae5998e0b52a071ca8b69cd21cb","observation_id":"1422e568-a62c-4f38-ab79-dae7400bd33d","resolution":{"observed_at":"2026-08-07T14:25:40.339854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.447842Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.447842Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:dccfd0a93a5d36ad3a47aff3eb31431347d943cfd707eb025ea4f0b836699a39","observation_id":"fc33e49c-0dbd-4179-8060-09fd3d69d3ef","resolution":{"observed_at":"2026-08-07T14:25:40.447842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.548668Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.548668Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:a338747f8cd7a4c15880e2e047ae5fc6fe646daa5f87f80d9c89f11162c94d36","observation_id":"4af47f56-f40f-45d5-a768-769402dbf9aa","resolution":{"observed_at":"2026-08-07T14:25:40.548668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.719622Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.719622Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:3a54405c5084c84dba1474ee7e00cff54939f0a5a5bc0b314a1f68a0318ddd34","observation_id":"8be89472-ba36-48a2-acaf-6c8964894f8e","resolution":{"observed_at":"2026-08-07T14:25:40.719622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.763798Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.763798Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:fc0ad0c9fb77c23375d0ff44a04f3a35750d3792f2ba343fe74300b173963674","observation_id":"7f365eae-08de-4075-bbac-827c029c8241","resolution":{"observed_at":"2026-08-07T14:25:40.763798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.821209Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.821209Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:b47baa712457cbd6621ab39072ffcd7882be7bbd54ec768d337d9a6b1531b03e","observation_id":"d92d34fe-6d3f-4d77-a3ce-7707b6eb1004","resolution":{"observed_at":"2026-08-07T14:25:40.821209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:40.877573Z","title":"Long context transfer from language to vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.877573Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:85f3b99db6932cc2f84d4d158a7559d08bed3602b92a1df87e8d068f7d964a4d","observation_id":"5d02863f-399b-481a-9883-b7c9f4745e9e","resolution":{"observed_at":"2026-08-07T14:25:40.877573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:42.816607Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning, 2025","venue":null,"work_id":"f975520d-47ba-4bdf-a3da-545530fa21dd","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:40.994352Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:dd2a7b5ef174cd5dc24d8dcd29f86c4c1003b33f76be47692ff1117d5a6704b5","observation_id":"3b05ae24-3ab6-4989-8d53-d93c74eedfa3","resolution":{"observed_at":"2026-08-07T14:25:42.901334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.057201Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.057201Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:eb94a2543fab02fab15e05a392519d76ba6dc871d792bdce1c0976ca729e1369","observation_id":"87dd1c2c-1b86-46ef-b568-3ddeb924ad6a","resolution":{"observed_at":"2026-08-07T14:25:41.057201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:42.607865Z","title":"Openrft: Adapting reasoning foundation model for domain-specific tasks with reinforcement fine-tuning, 2024","venue":null,"work_id":"50234c2b-7527-4370-b5c2-a4ec59556f82","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.091513Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:6414e40e13176ee25c36b21e28657da363c83b4a8024559c9f3419cabdf10b8b","observation_id":"b1ac7842-aec5-467a-a165-9a68c7a038f4","resolution":{"observed_at":"2026-08-07T14:25:42.697324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-07T14:25:41.182463Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.182463Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:97be51dbef3d786c23a50c580d5d2b88623c23d173d2a0f10e1a0a4b8a6b9653","observation_id":"a3773b89-0653-4ec5-83c5-ff8ee6856a14","resolution":{"observed_at":"2026-08-07T14:25:41.182463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:42.393589Z","title":"Multi- modal chain-of-thought reasoning in language models, 2024","venue":null,"work_id":"d63a54d8-9e04-4154-82af-b25cd8feba2b","year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.332337Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:cb183640cf8ff72dd01211a248f6856ed1eaa5f5f57b8311de1c5aaaacb01680","observation_id":"f0588aaa-2156-472e-bc48-20aefa853e37","resolution":{"observed_at":"2026-08-07T14:25:42.505700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.463000Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.463000Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:6f94a0e4962daab3dcefa8d0f5adaa9c157e6382cd40cb0114f6ae4ebfbb3e95","observation_id":"213df899-8b29-40ec-bc12-e26386b42818","resolution":{"observed_at":"2026-08-07T14:25:41.463000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.566529Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.566529Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:074ab67c1016a6c327bbe3354a077f59da202477c61d9010960e46acc8e7bc58","observation_id":"7a98b2a9-a395-4ccf-9c72-3c192bb9fa41","resolution":{"observed_at":"2026-08-07T14:25:41.566529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:42.158982Z","title":"Villa: Video reasoning segmentation with large language model, 2025","venue":null,"work_id":"200f3114-1d41-481a-97a1-15999eb5e147","year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.666069Z"},"links":{"citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:880129b29e21a9fc0d2ab5ede36d804b891b1431e5781b66dc77e54425b06c89","observation_id":"367c941e-1057-4472-9b44-5bb2de7f7d4a","resolution":{"observed_at":"2026-08-07T14:25:42.255405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T14:25:41.790587Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.790587Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:ef6330eb6e2af133f4f2ace0df4a2ad25e109fdcd5b5f7143fe146da758dd6dc","observation_id":"2ccaa982-07eb-45cb-9427-ff88ce35dd4c","resolution":{"observed_at":"2026-08-07T14:25:41.790587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 1 inbound Pith citation observation for arXiv:2505.19000."}