{"as_of":"2026-08-11T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c2e66880ffdb93338e2c1479c53327323df541002cad398729baab086a0a401","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T12:26:35.347190Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:44:30.446320Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T23:57:29.009867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-03T06:14:29.827113Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.23254","last_updated":"2026-07-29T07:40:43Z","snapshot_observed_at":"2026-08-09T02:44:07.474913Z","submitted_at":"2026-01-30T18:22:15Z","title":"Better Call Grep: Evaluating and Improving Grep-Like Lexical Retrieval for Repository-Level Code Completion","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T06:14:29.827113Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2601.23254"},"observation_digest":"sha256:438aa4196c3dfe3052b552dd6300f17d1af99e7a4279c68b75d0cb4be22d6a52","observation_id":"8fefce4c-9f16-436d-8401-14a1fc6533f7","resolution":{"observed_at":"2026-08-03T06:14:29.827113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2604.05079","last_updated":"2026-04-06T18:30:50Z","snapshot_observed_at":"2026-08-11T02:50:08.687959Z","submitted_at":"2026-04-06T18:30:50Z","title":"SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T20:20:08.590407Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2604.05079"},"observation_digest":"sha256:0c44cc9b15ba5f59b6020d227be00a52f333e5d6bb846e31bce10d7d05bfa662","observation_id":"1853d597-68bd-479a-9d74-f4b5a5de2089","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:f1e73139ae0f8b00b2cb0f08891e8daac342bfac6e0f7c88fb9e820a4d332844","observation_id":"6fdfb335-2546-416f-9041-2116e76163e5","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2604.22245","last_updated":"2026-04-24T05:40:46Z","snapshot_observed_at":"2026-08-07T20:08:59.059721Z","submitted_at":"2026-04-24T05:40:46Z","title":"Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T09:12:17.734060Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2604.22245"},"observation_digest":"sha256:23aa4f57287ce62e2433f7755f99a8d3733e26f3f910061afbff261899dbb867","observation_id":"c82f0a56-b982-41c8-abe8-02f30c77477d","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T01:16:46.714598Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T14:06:27.953376Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:f6c700c759898729450f0b965d4b80b9de6f3137ffc6331ee875cc34e9ca6ce8","observation_id":"9c9cd432-51a9-4eff-b391-3f0a94580521","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T01:16:46.714598Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:41.654207Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:19c4b8d9a5918c2c4e58f62df2320da2d28b4cd59ba3ad4d556dca1ad5b50557","observation_id":"87b5d782-aa15-4247-9fbb-5a5496436de7","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T01:16:46.714598Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:59.553683Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:42d4d35c49125841a2f62164c2ed21b87dffd8e6e734d0ffe952c264c2288c04","observation_id":"d7afae0f-6d56-4e21-b48f-558fcaf230c3","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T01:16:46.714598Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-25T06:08:19.956833Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:496efc227db3caefec3e08004bb4d79ce1d70ee3eb533603e220a66b81f88b0f","observation_id":"27f57a54-0925-4793-9327-0f5a7c295afc","resolution":{"observed_at":"2026-05-25T06:10:23.810108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.13831","last_updated":"2026-05-13T17:52:53Z","snapshot_observed_at":"2026-08-06T00:20:13.394323Z","submitted_at":"2026-05-13T17:52:53Z","title":"Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:16:07.851098Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.13831"},"observation_digest":"sha256:5b34f0380a150d5f724693a1b0f342bc25bea30453977a68d9a2bd327eeab670","observation_id":"5f715dfd-16b0-4121-bb77-847e8cd17f85","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:6ce93df202d2fab106532edf54d0715e47c5522b10e8b01d364c186cc036c739","observation_id":"2d7aa7b6-1fb2-4c32-aab1-d57edb0175ce","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T07:32:12.180233Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:e02cc28843f7da5bb9aaa242e8476afadd64004df7258d4cb63e65480c0603e5","observation_id":"f89b4fde-71dc-4784-8cb6-0e114f505ec9","resolution":{"observed_at":"2026-05-22T02:03:52.219011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T08:59:28.405218Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:308e83d66c5b0a43a34ca8716d991b014810fe3ca342067c5fb4617bd0622a2e","observation_id":"9d494c51-66e2-4e41-8b30-5e2ce9880069","resolution":{"observed_at":"2026-05-22T09:01:19.351659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:5b4bf244061d6d4f8c2e23c3b401d8f07e9ecdf7a9359080583ff50ed58f51d6","observation_id":"f2a19d64-227e-4966-b2e5-461947f50484","resolution":{"observed_at":"2026-06-29T23:14:02.223873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.26680","last_updated":"2026-05-26T08:16:16Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:16:16Z","title":"DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T17:50:00.740770Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.26680"},"observation_digest":"sha256:75601f7fb6a43b7bab27e652a486b57a7c63ccbe11e56e978d34b1ac602b8597","observation_id":"f51a4f7d-3e4e-4c37-8c49-fe4634c4e81d","resolution":{"observed_at":"2026-06-29T17:53:47.134508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.31529","last_updated":"2026-07-01T03:25:50Z","snapshot_observed_at":"2026-08-01T15:45:56.149226Z","submitted_at":"2026-05-29T16:43:06Z","title":"SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T22:57:38.477065Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.31529"},"observation_digest":"sha256:1e75a27700a90f26d45204065d8b6302e41e5cb57fa5349e5645223421af8d50","observation_id":"61dc3136-4bae-4c4c-b7e3-41a7414eda5d","resolution":{"observed_at":"2026-06-28T23:02:46.724918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.31529","last_updated":"2026-07-01T03:25:50Z","snapshot_observed_at":"2026-08-01T15:45:56.149226Z","submitted_at":"2026-05-29T16:43:06Z","title":"SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-02T22:53:35.213874Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.31529"},"observation_digest":"sha256:bf392fae5509063d83bcfe401d7c1c5291a0fef0cf8e2ab89aca97a1cd672298","observation_id":"72dbfd35-0cd6-4c54-a29b-e77cf02b29ce","resolution":{"observed_at":"2026-07-02T22:57:25.653996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:3e07bc0a2d8b0c1988f0131bd73ade1812df79ba3513e635d37b84227292f7b9","observation_id":"7fb84d69-481c-4343-82a3-1c1197003617","resolution":{"observed_at":"2026-07-02T17:27:15.009771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2606.09064","last_updated":"2026-06-08T06:02:05Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:02:05Z","title":"See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-27T17:35:07.667016Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2606.09064"},"observation_digest":"sha256:3d7e11f0ccd6586769023381607bb31966f0fb5c5eab8b7a1f5b1ae0482cdb40","observation_id":"01eed325-0932-4037-8540-251c083a5513","resolution":{"observed_at":"2026-07-02T23:57:29.011320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:e5bea5a9f50defecef0f14678af40d1640ca2bf90517a22910b210594ab893f8","observation_id":"33581240-59c3-4c43-9c98-6cadb8054af6","resolution":{"observed_at":"2026-06-30T06:34:19.468445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-12T06:04:16.637378Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02927","last_updated":"2026-07-03T03:50:09Z","snapshot_observed_at":"2026-08-07T23:48:33.179767Z","submitted_at":"2026-07-03T03:50:09Z","title":"VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:04:16.637378Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2607.02927"},"observation_digest":"sha256:85e4a442b71d12a526f101bb0b6db6f5b2d13b448b4dddd671157dc0e0fdda28","observation_id":"76827ce1-ff53-47e5-bcc8-1c7bf879aab3","resolution":{"observed_at":"2026-07-12T06:04:16.637378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-01T21:09:45.294808Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-08T05:22:33.805882Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:45.294808Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:ae4639a700a70a2739b94ecd6fa99aadce18d039de1eb770b2f2b40ba1e1be81","observation_id":"7ffb45fa-d594-474d-aa85-e13fd2a50c35","resolution":{"observed_at":"2026-08-01T21:09:45.294808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-01T17:47:12.458101Z","title":"thinking with long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17523","last_updated":"2026-07-20T03:56:43Z","snapshot_observed_at":"2026-08-09T15:11:31.679922Z","submitted_at":"2026-07-20T03:56:43Z","title":"Thinking in Video: Can Video Generators Really Reason About the Real World?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.458101Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2607.17523"},"observation_digest":"sha256:ea339ac3ccd96ead90a3a6b6c9327cb0829acdc4ea0ebc429022bd0b04d5e70b","observation_id":"5f57e935-e817-4ec8-8ad7-79753866fcaa","resolution":{"observed_at":"2026-08-01T17:47:12.458101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-05T04:44:30.446320Z","title":"thinking with long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-10T11:27:22.684781Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.446320Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0bdf3272eefb67a13001af73f5077c393887c0f77323116fcdea0b7ce5ca2c2d","observation_id":"fba83264-40dc-4253-a0ee-d9b25e798be5","resolution":{"observed_at":"2026-08-05T04:44:30.446320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.20785/citation-record","integrity":"/paper/2511.20785/integrity","json":"/paper/2511.20785/citation-record.json","paper":"/paper/2511.20785"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:9f8532bea1bb415b1f5dd22acde0daeea26d5072621ace034a27249d29cd80ef","observation_id":"1803a682-99dd-4f8a-8d36-d60618b5508c","resolution":{"observed_at":"2026-05-22T12:31:32.161590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:44bb3255a792692ef2197426c0aa5fa324555098021778a3dd1732dab095e20f","observation_id":"6a8aaab0-b1f6-4fde-bec6-dbbb05df58b9","resolution":{"observed_at":"2026-05-22T12:31:32.156486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eliciting good teach- ing from humans for machine learners.Artificial Intelli- gence, 217:198–215","venue":null,"work_id":"c0fb0316-c07f-4596-9b05-f7191c87c374","year":2014},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:7b62bbe6d7784cc7116a646bde95bde2bdd96d6b7fced2b895aaaf0b2de593a4","observation_id":"33645a7d-b6ce-4652-9c36-c75bc0cbcb9f","resolution":{"observed_at":"2026-05-22T12:31:33.431537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.111453Z","title":"Scaling rl to long videos","venue":null,"work_id":"51d8c593-7e1f-4b0e-a674-da3e22e07f8f","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:8b2785593809944db7448efeb1c31e0b606364e8afe9193466aa5c78bd79c473","observation_id":"2d58c8e1-1d83-48dd-b329-731707038f6e","resolution":{"observed_at":"2026-05-22T12:31:32.136039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:2e5696223d0cdbcec904dd124f3ac1a0d0073839db74de6006f464dfd0884fcd","observation_id":"a31ee9d4-276b-4c1e-ae4a-d15a60da42fc","resolution":{"observed_at":"2026-05-22T12:31:32.125373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":"2503.17352","doi":"10.48550/arxiv.2503.17352","metadata_source":"pith","pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","venue":"cs.CV","work_id":"de4c64e1-82b1-4f70-8311-a3539e7bf400","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:cd054717b08b56709ae32d1baae91531b11eb9f7800915dc0e6d9d04e4b8b185","observation_id":"7375c2a6-00eb-42f6-949c-aa42fe7a2fce","resolution":{"observed_at":"2026-05-22T12:31:32.114168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grit: Teaching mllms to think with images","venue":null,"work_id":"c0104bc5-86c5-4872-be7c-90c716500374","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:dbbe48628e47560e23dd155e7cff45d3b0ae81bdcff8c094e45cb5fa76089ff1","observation_id":"defd5cf4-3f2d-4a55-a75d-5f90f4a6b999","resolution":{"observed_at":"2026-05-22T12:31:33.532424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:7721e19ef70d66245a17b6132c273e689117a2d184a22081313cfcd915ea007f","observation_id":"3370bf28-1857-433f-94df-791457f86533","resolution":{"observed_at":"2026-05-22T12:31:32.130559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"49313e26-4c02-4e8a-8375-ff8e634687d3","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f2e73b749338eacc4539a253ebe0686cfa3646987c5f4f92ef372df203b73ad0","observation_id":"99a61f56-340b-4303-ac3e-1e475c8eafbd","resolution":{"observed_at":"2026-05-22T12:31:33.488721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"8d021289-e9e9-40ed-92c4-1f8c5476d9a3","year":2017},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:214566b79e3b411959392c72e079bbe9ec29bad7701e43b3615c81786befdad5","observation_id":"4a9e2d1e-a724-4175-a50e-7ecfea661c8f","resolution":{"observed_at":"2026-05-22T12:31:33.474382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:6f420bb31c38a878389d1a4b8e97142898b39c0e5871c713d6196306f85f9ed9","observation_id":"1860182d-18fe-4106-a32e-c950dc30d4d5","resolution":{"observed_at":"2026-05-22T12:31:32.211332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:d74f17b1faedb0804c89288a6ab1114ddf5266dd455450544dd8f987a714a028","observation_id":"d56bec6f-774d-4c95-9ee0-4f1f46841545","resolution":{"observed_at":"2026-05-22T12:31:32.167022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T17:38:13.144769+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:13.144769+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:13.144769+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":"2501.13826","doi":"10.48550/arxiv.2501.13826","metadata_source":"pith","pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","venue":"cs.CV","work_id":"365a8624-64bf-45a7-8a3e-c575aba224dc","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:39dde3a76ab86fb14de87ba07f6ffdf3d540d61ceebd53688452383355b04632","observation_id":"e7c55f0d-303b-4a64-9a88-1f4fcf08e9cf","resolution":{"observed_at":"2026-05-22T12:31:32.096789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11760","last_updated":"2020-11-10T21:49:14Z","snapshot_observed_at":"2026-08-06T11:42:54.284269Z","submitted_at":"2020-11-10T21:49:14Z","title":"Multimodal Pretraining for Dense Video Captioning","version":1},"cited_work":{"arxiv_id":"2011.11760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.11760","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition, pages 16783–16792","venue":null,"work_id":"03359a82-c215-4fa0-a397-fef8dede8820","year":2020},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2011.11760","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f34ed653258c47a72ef7904b46e482c1de17d534ddd2e41c0f3719eb3135b34f","observation_id":"db538753-134e-4d52-bcdc-7e22f7d36f1c","resolution":{"observed_at":"2026-05-22T12:31:32.141515Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:21feb21096489c9600cb65b9f0c4607055c95b28c555d349462df3da6355db54","observation_id":"4b039082-438e-4e4f-b285-182a2e3320e8","resolution":{"observed_at":"2026-05-22T12:31:32.190720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:470b9f5129edae28da9aa9fd96b80271d431a60ccd5ee5ac50badd2b05e969af","observation_id":"75ed6b6b-8a84-4e41-a107-081a0296402e","resolution":{"observed_at":"2026-05-22T12:31:32.045940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:49048c2cd79a4e268d46f97d00259310681463042f6d6d11cc38267313ec69dd","observation_id":"e013938b-4d46-4e6b-9aef-0ee10b22a32b","resolution":{"observed_at":"2026-05-22T12:31:32.220560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"04b57c48-b960-4414-8695-28fa2cee466c","year":2017},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:a56d372da03404ee3e0cb7fc572602ad35a2bf78f49e717e155167a6a1da33df","observation_id":"a40fa3c1-a31f-40e4-bdab-6b820b5dcc20","resolution":{"observed_at":"2026-05-22T12:31:33.420723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"fc8f580f-c2b2-4cba-bdcd-014ba3328f36","year":2023},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:93008fe0019b8b5d3f93454460b5ea65fd91cf9906f96ea76c23389359f9ee9b","observation_id":"3d5e9c8b-9e50-406b-9a2a-1182e14119b3","resolution":{"observed_at":"2026-05-22T12:31:33.412225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.255855Z","title":"Mmr1: Enhancing multimodal reasoning with variance-aware sampling and open resources","venue":null,"work_id":"ab34c4ee-e920-4745-ba3f-3cac237082a2","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:cbf2af23bbf6a70d0b0c8bbab5da6d5a5948882c98b684feb1b0d1029a16b51e","observation_id":"e162c062-dcd5-40dc-8676-d4dfd24e22ec","resolution":{"observed_at":"2026-05-22T12:31:32.206753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-10T15:19:55.764802Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":"2503.11197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-07-02T20:07:21.344787Z","title":"Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering","venue":null,"work_id":"124c7cde-3047-4ea3-b487-b56039243100","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:bef6261b5cd39f89d24bfa0100b632d4e3d8a6a05f1b492f4bfe7a889897cd9c","observation_id":"8f292c1d-1083-4035-b4a8-109329d1dec2","resolution":{"observed_at":"2026-05-22T12:31:32.069649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting more juice out of the sft data: Reward learning from human demonstration im- proves sft for llm alignment","venue":null,"work_id":"02167c76-8c85-4504-ae78-ff85454e435c","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f28debf9c9c294a8978e17e357e4c84171e9ce8da8ab40590d3f7ec658f8866d","observation_id":"ecf324f7-8933-45cc-be95-8205f0c92abd","resolution":{"observed_at":"2026-05-22T12:31:33.392467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.147378Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"e856d9fe-fdd2-4ace-b502-c96fc3bcb293","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:8aa973b78eadc33ea7a61397605891ff7da8e5f105e990da0d4072db7001ed3d","observation_id":"50c9cc20-5e77-411b-9639-32ae51d09f64","resolution":{"observed_at":"2026-05-22T12:31:33.386751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:aabcb95f71df9bde3432ee599c23b9f894036aca68931be072b9070005343732","observation_id":"ddf0c330-017f-4c29-bea1-aa1305376dbb","resolution":{"observed_at":"2026-05-22T12:31:32.080338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13956","last_updated":"2025-06-18T08:04:33Z","snapshot_observed_at":"2026-08-07T16:55:46.935677Z","submitted_at":"2025-03-18T06:48:08Z","title":"Improving LLM Video Understanding with 16 Frames Per Second","version":2},"cited_work":{"arxiv_id":"2503.13956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13956","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- proving llm video understanding with 16 frames per second","venue":null,"work_id":"60d33124-daca-4fc4-b375-e64031e22902","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.13956","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:93c31cb4bbc7f2b6c25a50385e7ace41faef640c90a6774b4187ec59c1d27468","observation_id":"e5e01f37-b4c6-474a-ad85-93bcaf1b25e0","resolution":{"observed_at":"2026-05-22T12:31:32.029653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":"2403.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-07-04T10:29:44.911015Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":"cs.CV","work_id":"88f4d72e-ee93-420a-a61e-64b02b8cc454","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:7c3d23fa6518e659f65fb9aa84242c585705dc8d90fbcf14225e7a2cbecfb008","observation_id":"6dcd0194-5192-4bb7-a88b-9347000e7bcf","resolution":{"observed_at":"2026-05-22T12:31:32.146602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":"2503.06520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-07-04T19:30:08.050016Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","venue":"cs.CV","work_id":"7a33b2a4-8409-4a00-ad7b-84e810df1ba7","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:70c2cd1a5e0a4f35ea47505559fefb905ec6d41b69dbaed64e15a371c346f06b","observation_id":"eb9ad06b-178c-4d09-a0f6-cdb573499716","resolution":{"observed_at":"2026-05-22T12:31:32.051892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual- rft: Visual reinforcement fine-tuning","venue":null,"work_id":"fcda1717-3fd5-4d22-b4d5-34da86376ef3","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:ca7f32ed57b2090f8586e468719561c2b3391228b81f108adc2ca2bb998f2022","observation_id":"a812e6fe-f005-4658-a14e-be7ad891c435","resolution":{"observed_at":"2026-05-22T12:31:33.528760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms engine: A simple, unified multimodal framework for pretraining and finetuning","venue":null,"work_id":"e1444f12-ff7d-425c-8233-72520fa4af74","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:767ec1b6230fa02b657b615d21d0047c557eb94028bb53e1c93e5b24dbebf621","observation_id":"9610c8f8-e10f-4c9f-9e40-f77919ce2090","resolution":{"observed_at":"2026-05-22T12:31:33.525298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"19a8e643-200a-48a3-8c57-b562d9d39bfd","year":2019},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:14e1424e94b7c4cf643bbc95ef09e94c227bf22aa0001ed25b81a5874ca52582","observation_id":"287c10d8-49d4-499c-8759-9ad328db39b3","resolution":{"observed_at":"2026-05-22T12:31:33.522210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:aeb3cb4556401294256d80a33dc242f53313b6dd4247f5865c5b4b98cdf68509","observation_id":"e830ca06-9952-4c82-8162-2386324ae9e8","resolution":{"observed_at":"2026-05-22T12:31:32.224788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.745204Z","title":"Multi-agent tool-integrated policy optimization","venue":null,"work_id":"dd624594-0a0e-443d-8cfc-90f240214e69","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:04dc7c32351b5801b57f1cad9089b9ea63f2041c9f90af67e95dbe4675bc853f","observation_id":"16d2845b-c608-46ab-a7b2-e6df01955518","resolution":{"observed_at":"2026-05-22T12:31:32.201926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10433","last_updated":"2025-08-14T08:15:41Z","snapshot_observed_at":"2026-08-10T19:07:05.708525Z","submitted_at":"2025-08-14T08:15:41Z","title":"We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2508.10433","doi":"10.48550/arxiv.2508.10433","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-math 2.0: A versatile 10 mathbook system for incentivizing visual mathematical rea- soning","venue":"arXiv (Cornell University)","work_id":"392be51c-c6dd-466b-8de4-9fc155165aec","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2508.10433","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f75bfacc629950189fa3eaaf15bc588cd0f7eab49eb9b6ab187afe4b1ee66c40","observation_id":"5703c378-62c0-4dbb-92fc-9865edcc08b0","resolution":{"observed_at":"2026-05-22T12:31:32.024121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"558aaf94-f919-4874-97ee-982435d76134","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:8f0c63ce3e9bf23a77aaf75eadeeec61c2be5a70b13597df44389666d43c5fae","observation_id":"019fc509-e74e-4ac3-a632-740d465dc066","resolution":{"observed_at":"2026-05-22T12:31:33.515092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f43bfc6389c1ca367508be6f10037960ac7fa2604158275c616117a7ac8fadb8","observation_id":"2e850eea-5ab7-47b2-8dad-97170513fb76","resolution":{"observed_at":"2026-05-22T12:31:32.181195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:af7c4e3d89cdae73de0bf3e67c3c3accc27d9c61114236bf3418cd4fa079989f","observation_id":"df2d44da-ba2d-454b-b5ea-d86e7af558d9","resolution":{"observed_at":"2026-05-22T12:31:32.175943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridflow: A flexible and efficient rlhf frame- work","venue":null,"work_id":"796c78d7-b4b0-4c5e-b81f-0447f484557b","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:de5c456789a82e478621c1fe98b0af6367ffb31c1b86a788cf69167cc598fa56","observation_id":"6c832576-f115-479a-9c46-b7c4754a6207","resolution":{"observed_at":"2026-05-22T12:31:33.510500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:00:11.687648Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"7c0ae08e-b184-4ff8-820d-9f6682eb176e","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:a3612c422a83bc418a177da356c75cac929d74ee7ffeb0a768fe0717814ffb10","observation_id":"10f7f488-b341-44b6-9381-09780649fa15","resolution":{"observed_at":"2026-05-22T12:31:33.505611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:12a5ba7270010301bab2d2c04fee542dfef2e0298627a0654445358bc1111074","observation_id":"e796a7eb-080e-45f2-a817-76cd249db505","resolution":{"observed_at":"2026-05-22T12:31:32.107643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18536","snapshot_observed_at":"2026-07-04T19:50:10.284267Z","title":"Reinforcement fine-tuning powers reasoning ca- pability of multimodal large language models","venue":null,"work_id":"59c7639b-064a-4052-a6a0-5504a24d72d6","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.18536","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:6f5656a657a98cbc398e240137178fdffaa3a4ceb008c6ad910570c5612858b0","observation_id":"5c9dc37b-4062-4914-bf2e-5acfc1754921","resolution":{"observed_at":"2026-05-22T12:31:32.085860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:6396b7657c99050ecd6b4e6bc5f1ee1b14c5b16386e09bd7474ae9ba98f8130e","observation_id":"8b062510-547a-4e97-8dfa-59e07ae1c9ca","resolution":{"observed_at":"2026-05-22T12:31:32.063982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-5.https://openai","venue":null,"work_id":"1b930b7c-3937-40c6-85c6-a9150780cd62","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:be569ffbe44f21f98d9b55b70a832db278f682d88b99e3f1184dc03d7751e74d","observation_id":"a03504dc-a5b3-4e47-ad21-f04005391ee2","resolution":{"observed_at":"2026-05-22T12:31:33.495472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking with images.https : / / openai","venue":null,"work_id":"20faf90b-3f7b-44d3-8d58-345e23866640","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:e519b4f8b2db23bb0505be148f6989cb371bc832fcbcbba806221387c6f2b4f6","observation_id":"e94abd91-47ea-4c4a-99f6-47dffcb31e31","resolution":{"observed_at":"2026-05-22T12:31:33.483019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-vl: Sharper vision, deeper thought, broader action.https : / / qwen","venue":null,"work_id":"5c3b7dc3-363b-46b6-a4fc-db5185137a17","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:674dc9b44dde2604a2dfd4e414e5626bfbe8059515c6eb3bf2986376a80f1ed1","observation_id":"01a1aca1-5554-4d88-99b2-06a043325214","resolution":{"observed_at":"2026-05-22T12:31:33.478846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:2da20ee41988f64564ad96af3ad3aa570cc8dfe93e34568e7c89d94a8010f6dd","observation_id":"25424899-9b6f-4a06-8cc5-23aa0f89dd3c","resolution":{"observed_at":"2026-05-22T12:31:32.236221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.905697Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning","venue":null,"work_id":"89c249fe-60da-4724-bb0c-770442676a88","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:5710aeed23c3ff7c4595b4b036feceb88ca15352b03fb4bdec026e295cd61252","observation_id":"3c1eae4c-1337-4205-8701-1199a1732dfd","resolution":{"observed_at":"2026-05-22T12:31:32.035289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23473","doi":"10.48550/arxiv.2510.23473","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-thinker: Sparking” thinking with videos” via reinforcement learning.arXiv preprint arXiv:2510.23473","venue":"arXiv (Cornell University)","work_id":"f6e8a985-4856-4397-9f14-221421fd639b","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f730770be3757c1c007da21d1cab41493751f7f63985488c71549f72b878b215","observation_id":"f3d31a6b-3bf4-423a-8d39-35b9d2f45f75","resolution":{"observed_at":"2026-05-22T12:31:32.230480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2406.08035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-07-04T16:09:57.146670Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","venue":"cs.CV","work_id":"e9bfdf40-cd28-4d57-98b8-31b7e97f9f2f","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:a1cabb39e01651e04bd13168a491c924f6eb783a5b834658617b286be8a0efa5","observation_id":"19aa4829-85a0-4bfe-ad7d-51b8bda8b69b","resolution":{"observed_at":"2026-05-22T12:31:32.242262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:34a6f6f7f4271f7b90ff934071050919fd874bb83f7acff8cbfe079e7557eac7","observation_id":"e0cb23fb-6be2-490f-aad7-b67241350fb9","resolution":{"observed_at":"2026-05-22T12:31:32.196643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15900","last_updated":"2025-04-29T02:51:19Z","snapshot_observed_at":"2026-08-11T00:24:21.562187Z","submitted_at":"2025-04-22T13:41:26Z","title":"SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.15900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15900","snapshot_observed_at":"2026-06-29T18:43:50.757623Z","title":"Sari: Structured audio reasoning via curriculum-guided reinforcement learning","venue":null,"work_id":"beb11fe7-2523-4438-aa50-dba3ffe01f16","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2504.15900","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:239e4faa7a1a37d7e67cacfbd96487d4127f69ac60dc1e8131a82def688121fd","observation_id":"a526b2e7-b85f-4423-9f46-b3b7a97e27a2","resolution":{"observed_at":"2026-05-22T12:31:32.091443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"6b76603a-3b1f-43aa-a14a-74a64c6a43d6","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:57f901dd511d6883705bd01f4697d8e5d6371d8ecb45e07fd14bc15e126d9999","observation_id":"171533f5-08aa-41cc-a06a-e0d09c4a442f","resolution":{"observed_at":"2026-05-22T12:31:33.466568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09965","last_updated":"2025-06-19T03:46:55Z","snapshot_observed_at":"2026-07-31T21:40:49.363128Z","submitted_at":"2025-06-11T17:41:50Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","version":2},"cited_work":{"arxiv_id":"2506.09965","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09965","snapshot_observed_at":"2026-07-05T11:41:02.594727Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","venue":"cs.CV","work_id":"ff3bffaa-30ad-4319-b157-10557ee89344","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2506.09965","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:6ce467899c5e3024c7b2f078ecd75550144458d9245ecf1716e5087eb43d1a1d","observation_id":"883dd067-7b04-4678-bc66-34470e1a4def","resolution":{"observed_at":"2026-05-22T12:31:32.151747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-cot: Let vision language models reason step-by-step","venue":null,"work_id":"f7e8c81d-4627-4c76-86c7-841039d7dffc","year":2087},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:c543d9646121ee279725d0f449c92113e9a6840759f50f79e5342f6fc1dbb8b1","observation_id":"08680bff-c31c-449f-8452-ea23d07eb820","resolution":{"observed_at":"2026-05-22T12:31:33.462026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidchapters-7m: Video chapters at scale","venue":null,"work_id":"0f3ac111-fcdc-4498-a286-91e2ab8914f5","year":2023},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:85a5965b490a51e359f5a015808136977d312b90a7e8160ae7cfb7183f962c97","observation_id":"74e7bc5f-527d-4477-b757-a666d5559e89","resolution":{"observed_at":"2026-05-22T12:31:33.453687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:08235c1370900dd1d197b8a7f626fe28bbb0c3d3c30b96c2badd0118fa79c121","observation_id":"10228c5a-7805-42a1-95d5-5b0c4b9a0011","resolution":{"observed_at":"2026-05-22T12:31:32.186280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mermaid: Multi-perspective self-reflective agents with generative augmentation for emotion recogni- tion","venue":null,"work_id":"45848316-3845-485e-874e-ce54a4a7ce33","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:37340e9812057790f9db9f960d9a0a9ad3722327b4a13da0f340c820853510fb","observation_id":"9865d19b-5c60-41d9-b3bb-e105a21e42ff","resolution":{"observed_at":"2026-05-22T12:31:33.448529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timeexpert: An expert-guided video llm for video temporal grounding","venue":null,"work_id":"ad50bbbc-b70c-4783-aad6-3d4c5847fd5a","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:c3ab287b509615c8595db41c3ba312af5488907363893a64c46b06809661517e","observation_id":"2c4e0aa3-df5e-4ede-81a3-84bc2f0d80c2","resolution":{"observed_at":"2026-05-22T12:31:33.442860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:b767a20f8d3f32b566d123604bbde2b6fee6f55461e7c20837338ce985447d3f","observation_id":"746dd75b-1364-4a2a-9759-2f5224962600","resolution":{"observed_at":"2026-05-22T12:31:32.040604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-09T07:51:37.523530Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":"2508.04416","doi":"10.48550/arxiv.2508.04416","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning","venue":"arXiv (Cornell University)","work_id":"824594ad-21b0-49b7-88f8-fac8553528e3","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:261796ee97a37ff26e0e51a71c145dffe2a39f56f04a0a70dab8572bc8edb48a","observation_id":"decedb93-683f-46c0-ade1-39bc7d6a6c37","resolution":{"observed_at":"2026-05-22T12:31:32.058146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":"59b45a6f-755f-4072-9836-ec53a9099c57","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:94d2e85a340e8424c5b7973e327df45120727022ca622c9cb9c7981a7a7cf6b8","observation_id":"83322ef6-a248-48a8-8aac-fb5d57a6bb21","resolution":{"observed_at":"2026-05-22T12:31:33.339109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:46.113889Z","title":"Open- mmreasoner: Pushing the frontiers for multimodal rea- soning with an open and general recipe","venue":null,"work_id":"066e7709-7685-4546-ba6d-050720c2fa2b","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:b219dc9e59934fd6244167f51e5480ac9433aa7ff08267682b25a871aa166838","observation_id":"4fc2f709-6320-443d-8391-1827576d54bf","resolution":{"observed_at":"2026-05-22T12:31:32.216194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs","venue":null,"work_id":"9bf596bc-9abb-433e-93d1-62d3dc4cf900","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:dc0a436063c28ae752c2679b0ea5e8e38ca70252ca8d8d6c40b3a5a2000e3424","observation_id":"12dcbb22-01b4-4ab3-adb3-bf8dfcb4a39b","resolution":{"observed_at":"2026-05-22T12:31:33.436174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:29ce970766220310324c765ee8ef326b17bb961a6ac52fd6998308259605958b","observation_id":"e825e151-6870-42c7-859f-199a1db069bc","resolution":{"observed_at":"2026-05-22T12:31:32.101909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:7c290be29c79563b81edbab85ec3595d93cda7495d86adb35112009e1a7111fc","observation_id":"9a349702-83c9-405d-ae4c-4abb8a12968e","resolution":{"observed_at":"2026-05-22T12:31:32.120343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking with Long Videos","venue":null,"work_id":"55bee3d8-0cf3-412c-8a87-db389d53588e","year":2018},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:dfcb3000488e30819a89f5a203c87993da00a8516402e712056524c46cf6d79a","observation_id":"dcbe1b05-3af5-4d01-abf3-0068c9992cbf","resolution":{"observed_at":"2026-05-22T12:31:33.415766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"global- to-local","venue":null,"work_id":"3e441fcf-e708-4cae-9c17-5f415e9cd117","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:694b075982f06d65335b5924a6b002c70a5170c768ff23f125def7610e4be941","observation_id":"63cd8ef0-b944-4d84-b09b-6b7da544ddbf","resolution":{"observed_at":"2026-05-22T12:31:33.426865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"black-box","venue":null,"work_id":"ae5a7613-68c4-413c-970c-25d8a69c0c08","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:108385ab9ac05602d2f64eef493b99d902551e67bace4b9ecaacab2278e43a41","observation_id":"c0c672d9-2f1b-4278-b36a-6728a0236cb1","resolution":{"observed_at":"2026-05-22T12:31:33.342766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72bf2909-48cc-4cda-9f6e-94e59ae0c33e","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:5f2dc7d788bac967193df67569c959c605159e5efb09f433254b7c462cb38c58","observation_id":"61b5ff77-1fa6-4418-87c8-73736968a10a","resolution":{"observed_at":"2026-05-22T12:31:33.408264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For a sequence of to- kensx= (x 1, x2","venue":null,"work_id":"7cab4c2f-4a33-42d9-93de-d15cc4a1b450","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:e647762a7e51cf0780d3c8aa3968ac92e9b9a0b0ee51d1c11d7119bc8c20973a","observation_id":"002d6096-c4c9-4e69-b0f6-5bce9fd7ae37","resolution":{"observed_at":"2026-05-22T12:31:33.404477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"segment","venue":null,"work_id":"7bda1f72-2abd-49ac-91df-fa228ca70317","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:cd835445087d3c3a44c8e9d84da2e317209d2ba638a556c11e0b5ce742b971bd","observation_id":"d5ad3a10-90e2-40e9-bf04-fbcf1d36130c","resolution":{"observed_at":"2026-05-22T12:31:33.400583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"of Training Steps 3000 160 1600 No","venue":null,"work_id":"9271ad43-1ffd-46e2-8b63-0ee0e1235365","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:68499494e2f654b0ce968665129ec9ef92a55c846331801cb98c68da97460564","observation_id":"b6f0680c-c77f-4eb0-9f8f-7dc3203ae0e9","resolution":{"observed_at":"2026-05-22T12:31:33.396484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3031.61834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To optimize training throughput and mini- mize memory overhead, we employ an online stream pack- ing strategy on iterable datasets","venue":null,"work_id":"d95f7492-b526-4033-b4d7-22f82c32ae0f","year":2014},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:f363cb87b58609ec83ce8bed509ba463e3c41274c14158efe3247163916959e1","observation_id":"0ab04516-4e0d-4549-bcbf-e862db263788","resolution":{"observed_at":"2026-05-22T12:31:32.074580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"blindly rephrasing","venue":null,"work_id":"1443c9df-5fc4-44bd-b1e8-cdefb220aec2","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:c1d4a2c31f03ca67876210f73cadf918fe603f475733a0309b46b7fdfdf8c4c1","observation_id":"38bf6c0c-35b3-47bc-93f7-c592a6dd817b","resolution":{"observed_at":"2026-05-22T12:31:33.366229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figure 8 shows the RL prompt template, while Figure 9 presents the evaluation prompts used in LLM-as-a-Judge [55] for measuring an- swer’s accuracy during RL","venue":null,"work_id":"2bf73732-d28e-40b3-a43e-77ba891abe4a","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:619e9b5f5e58a0b30cdea5db38ee469890f9a407f812fb531aacf2ddc3c442bc","observation_id":"8a7f044a-4386-4568-936a-957187704e86","resolution":{"observed_at":"2026-05-22T12:31:33.362311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"which video-game device","venue":null,"work_id":"f5f00487-9acd-4abc-ad08-d2cbca410599","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:2994d0d40d8d1b6482617695ac5dbe5353d18a2b615d5c5df26d4fb5e5e33ce1","observation_id":"d4ff94d2-b6dd-45af-a3d6-42b9ee544eb0","resolution":{"observed_at":"2026-05-22T12:31:33.354158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manager Agent","venue":null,"work_id":"220a9d90-0bb1-4d0c-8344-0d8262a1e352","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:1401da6cadab6e5abc8ca3ee5e921d1f6d53c1551801c01d617235d853d1638e","observation_id":"8e9e3b7e-3719-488e-87ee-e72e6c5cee4d","resolution":{"observed_at":"2026-05-22T12:31:33.358062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d896d4c7-041d-4f35-af9a-6ca6fed7bbdc","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:ebb071bcc848ddfb5843fed8af2e64e7f17705360ba410622f64960be159f970","observation_id":"96ba2574-6902-491f-97d7-db468b8068ce","resolution":{"observed_at":"2026-05-22T12:31:33.350525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"type\\\": \\","venue":null,"work_id":"7afc465d-41be-4b8c-b364-cb64643b2b84","year":null},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:b2211c2b7542ac73155d8f81e0c323bc9a9b62257d8a99c539a95db6587487cf","observation_id":"edd5039e-2c14-44f5-aa43-f6f811f9e65b","resolution":{"observed_at":"2026-05-22T12:31:33.346826Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":2,"verified_exact":39,"verified_fuzzy":34},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 23 inbound Pith citation observations for arXiv:2511.20785."}