{"as_of":"2026-08-13T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9288a7788ac06e3b9655c8880d8f57da954ffcbe2b7efd450e9623d77e59ac6f","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T19:37:09.244578Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:56:09.820812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T21:07:23.929020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"cited_work":{"arxiv_id":"2605.16079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.16079","snapshot_observed_at":"2026-07-02T21:07:23.929020Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","venue":"cs.CV","work_id":"0e60d904-0b9a-4a41-87a7-8ef9c3c00dd3","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2605.16079","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:d3f725c5c01912d7bd1acd71c3e49a6c81c5b73132a26600502064d2cf3cf06b","observation_id":"ffb93de8-b762-45ef-97df-7016bb2954df","resolution":{"observed_at":"2026-07-02T21:07:23.930391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.16079/citation-record","integrity":"/paper/2605.16079/integrity","json":"/paper/2605.16079/citation-record.json","paper":"/paper/2605.16079"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:aa30e0d80cad326061e361bfec6d53f1f323675f83043702b733b00f4c8f8d3a","observation_id":"d9fcace9-5fcb-4838-934a-6dced20c9da7","resolution":{"observed_at":"2026-05-20T19:38:56.049715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:5e32a0fca927869485e516bbc1d9481cadec7506a647f1448db9bb2a2a2665c4","observation_id":"42db01d1-b377-4212-af33-2e67655d431c","resolution":{"observed_at":"2026-05-20T19:38:56.043858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:24e1c1ec55e55270ecbd90e9d769a0cd1887726149357226ded1a2b436bc5dd3","observation_id":"dab4ccb6-f27a-449f-87aa-0db2c25d18af","resolution":{"observed_at":"2026-05-20T19:38:56.036772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d8a3fff4-c9c4-48b0-9376-86f36cf070ed","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:9a7a62b1c0f8da131c0d1e4983bedaee2e0e78be76de77980ded63355a0ee3d8","observation_id":"4080fef3-fcd3-4b96-ac0b-02bb11bc753a","resolution":{"observed_at":"2026-05-20T19:38:56.822686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33b7273a-f2c6-4ff0-82ae-191e7781ccd0","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:ac372142b63a2dac55c9d57901c49bd84cb41b7945721c043c570fcdeef61995","observation_id":"50e8a264-80a0-4048-b984-0c90ab22ea70","resolution":{"observed_at":"2026-05-20T19:38:56.825932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.111453Z","title":"Scaling rl to long videos","venue":null,"work_id":"51d8c593-7e1f-4b0e-a674-da3e22e07f8f","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:85c40cfef5d4052d877be2b3bb4cf173e6b85392c60d93f523568ad2b2fb320f","observation_id":"3e0da6a4-9c59-4c5e-b96e-034b676df229","resolution":{"observed_at":"2026-05-20T19:38:56.030979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":"2601.10611","doi":"10.48550/arxiv.2601.10611","metadata_source":"pith","pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","venue":"cs.CV","work_id":"f0dc2969-bd90-4a5d-81df-d557352690b6","year":2026},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:be291bf15ce14afef178bb71764fe40e4ea60bd4f4fa825459e16f4a1341c490","observation_id":"133add86-adfe-404f-af4b-8518ce6262c6","resolution":{"observed_at":"2026-05-20T19:38:56.023943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:a4dcbc79fbf9cc484a1edc456a10465f7cec1ff616a47a214f0ba41b4a779f49","observation_id":"fb1dcc8d-2260-4d4b-9ddf-679b459cb2cc","resolution":{"observed_at":"2026-05-20T19:38:56.160444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deitke, C","venue":null,"work_id":"62479421-1ef7-48a3-84ae-c11ad062b2d2","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:66cd96d5450cfe05d00e836faf3656556b65de9440547bbeb93bb49f2c226dd3","observation_id":"bef46cfa-f24a-48c4-a295-3b866e1e7c1a","resolution":{"observed_at":"2026-05-20T19:38:56.841511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":"2503.17352","doi":"10.48550/arxiv.2503.17352","metadata_source":"pith","pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","venue":"cs.CV","work_id":"de4c64e1-82b1-4f70-8311-a3539e7bf400","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:ec04315ae00922a608accfc0f4591e1aa2f7b09d32d274d7c31a68099911605f","observation_id":"954bc2f1-15de-4634-b0a3-6da3899382b3","resolution":{"observed_at":"2026-05-20T19:38:56.101572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:052abd0d348866fe36d362a60c74da0a6082614fb77b0ae7070482177b620830","observation_id":"7240c959-ae34-4a33-9109-438ac891ddf7","resolution":{"observed_at":"2026-05-20T19:38:56.077048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c504a11-38db-4725-adee-4edc548608c6","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:693f3a53f445a97d7eb35d6210c541b078a673467e53f8b55a3cbfa73406b12c","observation_id":"956c3ab7-0b4a-413b-9f99-ddc874cae06d","resolution":{"observed_at":"2026-05-20T19:38:56.835091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:47ae2bf2e1d4b55a7b4d105bb8a184413fc51864dcebf5c56bde29ee261d98ab","observation_id":"b84f70d0-e1dd-49bd-8aba-a00038a72761","resolution":{"observed_at":"2026-05-20T19:38:56.095685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":"2511.05271","doi":"10.48550/arxiv.2511.05271","metadata_source":"pith","pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","venue":"cs.CV","work_id":"0bc8f779-a287-4c6f-95b2-daffd15ad044","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:7586c9f66a0ebee1179d8ba3e6d262ea46e51a8e803ba0d0f03e897f103838b4","observation_id":"6667f4f9-fa11-4a7c-b2f3-5486177912bb","resolution":{"observed_at":"2026-05-20T19:38:56.194938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26752","last_updated":"2026-05-12T15:07:13Z","snapshot_observed_at":"2026-08-12T23:40:41.908226Z","submitted_at":"2026-04-29T14:49:37Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","version":3},"cited_work":{"arxiv_id":"2604.26752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.26752","snapshot_observed_at":"2026-07-04T10:09:45.391749Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","venue":"cs.CV","work_id":"0b17ea7d-55ea-42eb-b903-68fb980f9a60","year":2026},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2604.26752","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:0c087b190f964ee13dfb96af3034578aa4a332b0312e29e0ea7a75c756cb3418","observation_id":"724b1f36-3924-465b-8c8d-8c3e27935671","resolution":{"observed_at":"2026-05-20T19:38:56.204131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:1f853a40a1ddb052d77f6ebb01ae6515436bbf6d2b82de6247681430e9b8a5fe","observation_id":"033e7999-356e-44da-9eb9-f5ec98b5dee9","resolution":{"observed_at":"2026-05-20T19:38:56.115052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:9ee484a356a201e93ee472c807ace2e7da9a4f0ed40d190bf47634953e5a0fd5","observation_id":"36c84333-657a-4de6-9f99-c8c2a3e817e1","resolution":{"observed_at":"2026-05-20T19:38:56.137975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:002fa072f55d4c81e09bb89fd0023860cf4e587bd1e56ae338d1d3577ad625ef","observation_id":"4c1b3d22-9c60-4068-b415-1ae35841e91f","resolution":{"observed_at":"2026-05-20T19:38:56.214119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b6aff43-6fc8-46d9-9c5d-4ef0cf21cab5","year":2023},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:784ccaca8e5934dcf4ab5af1b29435c99b5936a49ef7c48a363c1cf32da8c7b6","observation_id":"ece79d5d-84b9-4c61-b10d-db5e7d654379","resolution":{"observed_at":"2026-05-20T19:38:56.850465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:afb42ddb8135f922248cbbb35bf9fa6cde880d6e3e7dfde1f0b06dc2a53588e1","observation_id":"fc5a4d8f-d159-4562-a050-5776a51eb635","resolution":{"observed_at":"2026-05-20T19:38:56.110678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d121fa61-01d7-43f3-a341-153adf7d3776","year":2034},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:d28d55e6a30c93e4b16562fe954da1acb6f012a403597ec8efc6ad2b0b6dc574","observation_id":"aef889cd-b2f6-4c31-af80-19783c661372","resolution":{"observed_at":"2026-05-20T19:38:56.862369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:50c9cfd15b2102c9fada0aa3124ae0084fb8cb401fd4f25e1eb633df1d6de505","observation_id":"93ae7cbe-87a3-460f-8006-6d501706aac9","resolution":{"observed_at":"2026-05-20T19:38:56.081767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07956","last_updated":"2025-04-10T17:59:03Z","snapshot_observed_at":"2026-08-07T16:06:45.494945Z","submitted_at":"2025-04-10T17:59:03Z","title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":"2504.07956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07956","snapshot_observed_at":"2026-07-04T05:49:36.609405Z","title":"Vcr-bench: A comprehensive evaluation framework for video chain-of-thought reasoning","venue":null,"work_id":"bc64fca8-39fc-44be-bafa-6fefc7c0275b","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.07956","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:779dec91fef41092b6179e54c8115182ecbd490259e469cd897db971e966c3ec","observation_id":"d8b2736d-495a-4c49-935c-a4edf52757d8","resolution":{"observed_at":"2026-05-20T19:38:56.199595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:45:49.217830Z","title":"Rafailov, A","venue":null,"work_id":"c7d1e7ac-6ed9-4e84-b7a0-d4340a50bed7","year":2023},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:3787e52270d4bf5c383d9a9ebbbb2f98f23c9bd4b3d9a4221b57b14da52dd2f9","observation_id":"0aa0c5cf-ce6b-4c0d-88bd-5e6a763ca483","resolution":{"observed_at":"2026-05-20T19:38:56.831681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50b5c211-0a66-4420-86f0-fc92047c9b1b","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:1e873621e9f061ed829137a29a7a720893c788b29ccea08794821d8a39ae06c6","observation_id":"1cdf0074-dc20-4286-9008-cd13f20818b3","resolution":{"observed_at":"2026-05-20T19:38:56.865253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:91a1128625e559a53cc8c690c22b9a90e9e02d736fdb26ccb7ce8723d9861424","observation_id":"4a691e5d-624a-4824-a9d7-58de885ad914","resolution":{"observed_at":"2026-05-20T19:38:56.119699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-13T05:30:51.244198Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:338ded1f301c4dbd0c33eecf06f94d7173ed9b5fd48d9a519af781170dfaf1a1","observation_id":"390cf3a5-ba9a-4ac8-bb4e-a3208d65369c","resolution":{"observed_at":"2026-05-20T19:38:56.071277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:d79f078a92cf8b2b80f326e7d113e2e01bfa6acc6dd2a62aff2a52d7dbd0984d","observation_id":"75c0588e-3c48-4560-ab2e-ba78f482dc68","resolution":{"observed_at":"2026-05-20T19:38:56.060197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:ad1cc07f92e72908d45f31c006e827abe980aa0488cd565b1ab0349d8b2edcb8","observation_id":"8aa51fc0-5987-48ad-87c3-a7f570d73e63","resolution":{"observed_at":"2026-05-20T19:38:56.054884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef762e19-3397-4ad2-88ff-4ea87db49d09","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:25af0c62d67ea5b59a0b1ef3b6efe2491c837fad77ad7132dd06628a2803c71e","observation_id":"e8e268aa-037c-43b6-a53f-1d66bda2faf7","resolution":{"observed_at":"2026-05-20T19:38:56.828669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:504f22ee151bd423b28a0c93f9b862fde504fe51ceae55bab62dc9daf6e6e19d","observation_id":"109b9733-637a-465b-a045-29273b932d53","resolution":{"observed_at":"2026-05-20T19:38:56.129604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-12T12:30:05.677115Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":"2512.16918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-07-02T15:17:07.348481Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","venue":"cs.CV","work_id":"44442f1d-245f-4d87-aca6-5a750593aad6","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:184fd5e2282aa0c077843d46cb0d7312b37a32e9ff298addbe6a57a4439872ff","observation_id":"2929d93c-b76b-4d33-b6d6-7102987ee55a","resolution":{"observed_at":"2026-05-20T19:38:56.147802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:a2c22782bc7f80023a1a15ad7475e5755aa00fb07a3a7f2a65c5df0e598eb264","observation_id":"5556ed8a-a58e-4756-b793-846d66f0c2cb","resolution":{"observed_at":"2026-05-20T19:38:56.065492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.905697Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning","venue":null,"work_id":"89c249fe-60da-4724-bb0c-770442676a88","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:e79830393991af3d5ba7e8b27a9ceb75680955c72512e4e540f368514d488366","observation_id":"c2dbb5f8-e64c-4eeb-8cd1-be369d07c850","resolution":{"observed_at":"2026-05-20T19:38:56.186027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23473","doi":"10.48550/arxiv.2510.23473","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-thinker: Sparking” thinking with videos” via reinforcement learning.arXiv preprint arXiv:2510.23473","venue":"arXiv (Cornell University)","work_id":"f6e8a985-4856-4397-9f14-221421fd639b","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:654c63ddbf17f1dd13dae16e53ae4d228783147ba1bb2ca91523bd1b1cad5dcc","observation_id":"58b44ea4-88a4-4ac5-a044-eb752caec526","resolution":{"observed_at":"2026-05-20T19:38:56.086589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:0f5b17acd82d9100a1e59f495805ade945297c5caeb0a7e923afb0a49cac9e6b","observation_id":"c8fd74a3-a013-429c-8099-de10dffb0c1a","resolution":{"observed_at":"2026-05-20T19:38:56.175051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:5ad7f4e70d6897b73e3af272d4058019082293d99bb358fe5f5e868d585e7032","observation_id":"87698de1-9b46-4c55-aa86-242a60097b5f","resolution":{"observed_at":"2026-05-20T19:38:56.133728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c79ba239-5baf-49dd-893e-71452c6470d3","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:9a91e334f9eeb8404264c81ada38521c8823d577b81091b18836cce11597b954","observation_id":"9614726e-eb0b-4fda-bd34-84be4af8c00c","resolution":{"observed_at":"2026-05-20T19:38:56.859353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09965","last_updated":"2025-06-19T03:46:55Z","snapshot_observed_at":"2026-07-31T21:40:49.363128Z","submitted_at":"2025-06-11T17:41:50Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","version":2},"cited_work":{"arxiv_id":"2506.09965","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09965","snapshot_observed_at":"2026-07-05T11:41:02.594727Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","venue":"cs.CV","work_id":"ff3bffaa-30ad-4319-b157-10557ee89344","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2506.09965","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:54e2691581a46645e65cb2e200df36ab8257766d33c781ca994739fa91b0db90","observation_id":"bcbe7025-38af-495a-a854-55d0d44d8e57","resolution":{"observed_at":"2026-05-20T19:38:56.190292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.894558Z","title":"2509.22647 , archivePrefix=","venue":null,"work_id":"ecb4f3f1-53da-44ef-82db-ebc4b6314cf6","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:5870d623b80d1e8d3f0e88102cf247ccbac7ff813da0a2fc943686c70dd75180","observation_id":"b6c88fac-f9bf-4ae4-a27f-f742260f2aa3","resolution":{"observed_at":"2026-05-20T19:38:56.179679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b8f032bf-d4d7-41c4-9a5e-19438503e082","year":2087},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:c98aed858e0a5c8b3a4482d2b919d86e3540fe03fa69c2ae0b0b2f83a56a6ca9","observation_id":"da80de83-4719-4fac-b2ca-1930ce3bec7b","resolution":{"observed_at":"2026-05-20T19:38:56.847454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d7f4dbee-e975-4024-9f62-a705bf2f9ddf","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:cd923bf9d17f21b69974f0c16a8001d82a665c68e0b4d6a51d63f4b640caf1d5","observation_id":"0f5c71be-3f89-4238-9bb5-5e86c8acfa21","resolution":{"observed_at":"2026-05-20T19:38:56.853507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-08-12T14:21:45.818304Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:dbea90d1b2467546622267bb154b29144dea092a2ed1ac277ca91b221685a325","observation_id":"2d7aa7b6-1fb2-4c32-aab1-d57edb0175ce","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-13T15:29:01.468730Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.07954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-07-05T11:41:02.675605Z","title":"arXiv preprint arXiv:2504.07954 , year =","venue":"cs.CV","work_id":"35656592-ffc7-4aef-9baf-0f8694c0c987","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:0de8db867ffde6cb77376fdbb59152f6fa413cc0097186bc6f19018abe25e88e","observation_id":"048032d9-4f39-43d3-b943-7d2ca08caca8","resolution":{"observed_at":"2026-05-20T19:38:56.151767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.918077Z","title":"arXiv preprint arXiv:2510.01304 , year=","venue":null,"work_id":"018cbc22-787a-4b43-b731-08e5fbe9d7af","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:707354cdc06ad7f9e8cfad888e53eebb849ca3b9eed29cb356df2ad1ed713014","observation_id":"ff4f1e5b-159b-451e-af00-bc5c58d53205","resolution":{"observed_at":"2026-05-20T19:38:56.106220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"870374f4-79d7-480e-89a0-651be005fc35","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:ba99d1cc93b62fc57bd0293b5ee2b850af14d77e090cddf04ba35e2ea83804e9","observation_id":"76a0227e-420e-4729-9094-3c4b979242f9","resolution":{"observed_at":"2026-05-20T19:38:56.844594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-09T07:51:37.523530Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":"2508.04416","doi":"10.48550/arxiv.2508.04416","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning","venue":"arXiv (Cornell University)","work_id":"824594ad-21b0-49b7-88f8-fac8553528e3","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:a133a5865ede8bffb0f2927fc77632677ec714b45e659b60daadc1a3510d407f","observation_id":"dc24a0bc-2ecd-4ac9-a3cb-69a18fe83560","resolution":{"observed_at":"2026-05-20T19:38:56.091241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:dbcf1a4812871eaea41762cf05c1a759a4149e1326bfab3fe438ed82bffacb06","observation_id":"448d1f33-452d-4cf6-a735-0979ea1fcaf1","resolution":{"observed_at":"2026-05-20T19:38:56.164285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07998","last_updated":"2025-08-27T07:42:56Z","snapshot_observed_at":"2026-08-07T15:21:56.692035Z","submitted_at":"2025-07-10T17:59:55Z","title":"PyVision: Agentic Vision with Dynamic Tooling","version":3},"cited_work":{"arxiv_id":"2507.07998","doi":"10.48550/arxiv.2507.07998","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.07998 , year=","venue":"ArXiv.org","work_id":"baf608ff-7eeb-4238-bf28-c54581129d83","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2507.07998","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:359eb10ede9f785356f58e1c9f159f67f00c2937c49a700b9d3243b1a738f844","observation_id":"c30a972a-050c-4254-b6a1-64422ca970f8","resolution":{"observed_at":"2026-05-20T19:38:56.208850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.17736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.868093Z","title":"arXiv preprint arXiv:2503.17736 , year=","venue":null,"work_id":"ccd0a79a-2de4-4173-8275-4245b75d00d0","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:dc65de4bbb665972fcaad7531d812c83efc7d54280f2106073c22a615f3a1e0e","observation_id":"2559cda7-ba7b-4b36-aee5-c2a2bd123b0d","resolution":{"observed_at":"2026-05-20T19:38:56.123950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zheng, R","venue":null,"work_id":"b0f48cb2-f02c-403e-8001-224b1efbb3cb","year":2024},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:5a2b97422d50746e0d8224078a77ddc8bd8921658faa271fa12320f2fe5a1f29","observation_id":"6be654b1-6c48-4f26-8947-ee1dd3361bf8","resolution":{"observed_at":"2026-05-20T19:38:56.838197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:c3fe5dac9c02f6a127f54d3854820ca126ddcb8dc1febeeb22e46bb19f741007","observation_id":"3d3cbc2d-c047-4a1a-95b9-48328891898d","resolution":{"observed_at":"2026-05-20T19:38:56.143658Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"1f93b3ee-8149-45f8-a463-59ff0c3aecfd","year":null},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:9a4bc998eae7176873e046ea825ed3eadcce27f431cb837d0d5573fab62c26de","observation_id":"c6949fc3-ed6d-4f23-930b-9d79029ca9a7","resolution":{"observed_at":"2026-05-20T19:38:56.856749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":36,"verified_fuzzy":4},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2605.16079."}