{"as_of":"2026-08-08T08:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be728f809b076a84b7c90b846e613d4054abd711e5c0bf36f1b8e94d611386e1","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:50.329904Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:30:02.227226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:08.052620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-08-03T09:30:02.227226Z","title":"Fostering video reasoning via next-event prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-08T07:44:31.776591Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.227226Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:d266fdbf3ed49aba5f1412fe5dabddc3bcefb00ea71cdca840732269c71f0d22","observation_id":"999cd9e9-7450-41b6-81d1-bffa35dbba45","resolution":{"observed_at":"2026-08-03T09:30:02.227226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2604.19564","last_updated":"2026-04-22T03:52:37Z","snapshot_observed_at":"2026-08-02T07:56:38.738222Z","submitted_at":"2026-04-21T15:15:02Z","title":"EgoSelf: From Memory to Personalized Egocentric Assistant","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:21.119521Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2604.19564"},"observation_digest":"sha256:06ca3b9941c2dd2892dc9b6c71fbe013f2a9262af35be94cb0d05086c19e2eaa","observation_id":"9a9dbaae-8460-4fa6-a39e-5f07afa41cf8","resolution":{"observed_at":"2026-05-11T13:06:03.692100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2604.23348","last_updated":"2026-04-25T15:10:25Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T15:10:25Z","title":"EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T08:34:14.297331Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2604.23348"},"observation_digest":"sha256:e29ad148b37802f19f4b4c61413f764a6f371166b7abc3d80d383d1b0f832df7","observation_id":"d5dbfd85-61ed-4384-aae0-8589d7c3ab8a","resolution":{"observed_at":"2026-05-11T20:31:15.231278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:789a708d1e55e8b7c5c8bf739291bbaff18afbf64155bca708f2837a4d48b670","observation_id":"b5ace437-a666-4879-885c-3a35be18a4dc","resolution":{"observed_at":"2026-07-02T11:56:55.449447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-04T14:09:28.537223Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:d92a369124f7f6ac11b490f79525228a18b62942bda955c06b0991059bc531d3","observation_id":"416437f4-13df-4c83-977f-687485dc6d1b","resolution":{"observed_at":"2026-07-04T19:30:08.053934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22457/citation-record","integrity":"/paper/2505.22457/integrity","json":"/paper/2505.22457/citation-record.json","paper":"/paper/2505.22457"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:10:39.795809Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:39.795809Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:3f3717547df7c321cd238522996e7679d498ba9bf9361fb51fb7437f1ac8ab54","observation_id":"a8b243e2-10bb-45c5-9874-d119d25b607b","resolution":{"observed_at":"2026-08-07T13:10:39.795809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:10:39.920205Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:39.920205Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:4611dc19c3603ad29ce1a3baa66741d165046a43dfb3a08ebd4a9a16221a0e55","observation_id":"e1344f05-fac6-4083-b108-4d82a83f50ae","resolution":{"observed_at":"2026-08-07T13:10:39.920205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:10:40.123547Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.123547Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:7fbb379691cf924cf8a0a4f65cb9afdab87e91fd841ae85e2054173f0b5e3535","observation_id":"f7b28bc2-524b-4bd9-828b-d89f18750afa","resolution":{"observed_at":"2026-08-07T13:10:40.123547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.730155Z","title":"Perspective—discovery within validation logic: Deliberately surfacing, complementing, and substituting abductive reasoning in hypothetico- deductive inquiry","venue":null,"work_id":"78b57d0d-eadd-439d-92f0-31c5ff0523ab","year":2018},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.267143Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e6443ab04d5979e3a0f008ec607b3ad2e66dfc9bc75b9c01a667844145157df0","observation_id":"b97c9119-9168-41fa-acfe-81ee98f6fb38","resolution":{"observed_at":"2026-08-07T13:10:58.806676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T13:10:40.431117Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.431117Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:0e7ff06564237f6aa751ddbf696078d6dda08a6887985b1a52f2de54d8069f8f","observation_id":"8c97c53f-09c4-49cc-a2be-eebe6f273efc","resolution":{"observed_at":"2026-08-07T13:10:40.431117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24376","last_updated":"2025-03-31T17:55:23Z","snapshot_observed_at":"2026-08-07T16:19:42.924626Z","submitted_at":"2025-03-31T17:55:23Z","title":"Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24376","snapshot_observed_at":"2026-08-07T13:10:40.647005Z","title":"Exploring the effect of reinforcement learning on video understanding: Insights from seed-bench-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.647005Z"},"links":{"cited_paper":"/paper/2503.24376","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:3d61d2db8e93ca728b27c9196d52b662dde8c85f47a219889af9580e5367aa1d","observation_id":"1ef549fe-3383-4fb6-8f03-86eaa348bf98","resolution":{"observed_at":"2026-08-07T13:10:40.647005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00114","last_updated":"2024-08-07T00:52:07Z","snapshot_observed_at":"2026-07-06T18:55:15.704075Z","submitted_at":"2024-07-31T18:47:11Z","title":"Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00114","snapshot_observed_at":"2026-08-07T13:10:40.763426Z","title":"Inductive or deductive? rethinking the fundamental reasoning abilities of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.763426Z"},"links":{"cited_paper":"/paper/2408.00114","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:cca8cd231cab91b1f5f55e405e01004a5705323ee026837a4a6c57b25127069f","observation_id":"0791a0bd-f9d3-47f2-86ad-e93cedb888e3","resolution":{"observed_at":"2026-08-07T13:10:40.763426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T13:10:40.921513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.921513Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:1ba28635b2d155e6e2c3fd87038becfc1cab34eda5f3612c57eee405727ce695","observation_id":"ec8e0ee3-de3c-4682-8d6c-becc925384ba","resolution":{"observed_at":"2026-08-07T13:10:40.921513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.543199Z","title":"Abduction","venue":null,"work_id":"531fd090-1247-4a67-b81d-e569f505faa0","year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.070272Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:04176a4630a0a4723e939d3680ebff543ef62f2493390a93eb974b9cde6a35a5","observation_id":"fbbad63a-714e-4059-9099-f57c7e3879de","resolution":{"observed_at":"2026-08-07T13:10:58.638631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T13:10:41.225273Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.225273Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5e0e485cb1338e547a65619b830aeff47e267e5c0158b3ec0b24ed57d67e83ac","observation_id":"1b26eba1-f86e-44d0-a8c9-12b66e821277","resolution":{"observed_at":"2026-08-07T13:10:41.225273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.252850Z","title":"Predicting the future: A jointly learnt model for action anticipation","venue":null,"work_id":"1714ae83-e08b-4a0d-ab31-38e5c387b6a3","year":2019},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.432388Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:780fe61a9529754aa4d47818d75da9752ff95d8fec49edf27106c56c2fc48444","observation_id":"2e760cb1-9cb8-4792-91bb-0b81ab3a281b","resolution":{"observed_at":"2026-08-07T13:10:58.366839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.028627Z","title":"Inductive and deductive reasoning","venue":null,"work_id":"b27620ca-004e-4b90-9f9e-7fa49d23bdcf","year":2010},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.566747Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:93c0f9312665db4b736fbdd6e406f1a904e4219c69b383176e31382c85f80c70","observation_id":"9b41be81-a1e1-4170-869d-90f1cb2964ec","resolution":{"observed_at":"2026-08-07T13:10:58.139151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:10:41.740834Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.740834Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:985a611a61831da911f21e779b42bf14fc8803c776537b923dc7f70037b9d38d","observation_id":"da3b778a-9a18-401d-8f84-3217ffe933f1","resolution":{"observed_at":"2026-08-07T13:10:41.740834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-07T13:10:41.915486Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.915486Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5dd0090692a96e0a904251c2d62d299e5ebf14379cafb9f3c94ce92925697714","observation_id":"96b992c6-8922-45e8-99df-b3e8f37d511e","resolution":{"observed_at":"2026-08-07T13:10:41.915486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:10:42.048397Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.048397Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:1667fdb92986772f6b7247bb3358278a4aac2fe90ab9e81647b3e00e3e8d2f57","observation_id":"3b1b8a55-698f-4d8f-be06-2c98a3185948","resolution":{"observed_at":"2026-08-07T13:10:42.048397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.745557Z","title":"A hierarchical representation for future action prediction","venue":null,"work_id":"c71afa5d-02ab-40c8-90cc-41f962102c9c","year":2014},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.221938Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:313ceb8d19e4e97150b1c0c248890fa207c7b0e096598591be6af793cf5f6cca","observation_id":"14476e3b-fe1c-4b0a-b790-b5bb495e1be7","resolution":{"observed_at":"2026-08-07T13:10:57.895421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:10:42.300383Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.300383Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:466bf666530b35883a38857d5f0b89ab5f6c029e009c2694d98b7b6ff2260eae","observation_id":"59de5145-1f66-4698-94f4-6ffbe66328ce","resolution":{"observed_at":"2026-08-07T13:10:42.300383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:10:42.429393Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.429393Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:d18c93c6f351403e8279877c408e6e9630776c08961689378d5d7297cceec6e7","observation_id":"481d3352-d8e1-4c05-97e5-2b773533b625","resolution":{"observed_at":"2026-08-07T13:10:42.429393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.566011Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.566011Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:489b4b60f93028f5be02c3db2181d708250e6681cbdd739dad8cb80f11ec8ef9","observation_id":"a60049e2-c685-48d0-a8f6-1cad7c51724f","resolution":{"observed_at":"2026-08-07T13:10:42.566011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.721721Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.721721Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:4fc69ea539e42b2d638726fb0bd8f3513442cdecd3b193d2f967ca902e068c5a","observation_id":"450bb94b-80e9-4bc3-ae25-9225c7105aa6","resolution":{"observed_at":"2026-08-07T13:10:42.721721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T13:10:42.860422Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.860422Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:6a968acb4e9b6101c928c55f5bd014f2dc5dd211eaeffb7d5962098bc8547f31","observation_id":"84733f08-cbc8-4014-8a9b-a32583d0674b","resolution":{"observed_at":"2026-08-07T13:10:42.860422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.994162Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.994162Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2fc8244d42c4ceebfa4e430807512a450efdf5cf4453803fe0e1042f1be77766","observation_id":"0160fd17-3872-42e9-8f2a-753a0538dea6","resolution":{"observed_at":"2026-08-07T13:10:42.994162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T13:10:43.177211Z","title":"Tempcompass: Do video llms really understand videos? arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.177211Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:94d3bcba1b9515e00ac496d1fef9d7428228a8214e64c1008c8b9c64ae8f6640","observation_id":"fc1f4c3c-6c0f-41b0-a710-4a3506c49205","resolution":{"observed_at":"2026-08-07T13:10:43.177211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.311301Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.311301Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:f32bb886355f9704642f59d17f238693f602a121808c80f414e4192e869d239e","observation_id":"afe341c0-7073-4c1d-882c-34ab70420a31","resolution":{"observed_at":"2026-08-07T13:10:43.311301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.456195Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.456195Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:060b5502777d624d9688b6a3403b0d15bc15938508e2c1e512e0d1bdabdca287","observation_id":"a9610f74-06b6-42ca-8980-6a344a6c5767","resolution":{"observed_at":"2026-08-07T13:10:43.456195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6604","last_updated":"2016-05-04T14:01:42Z","snapshot_observed_at":"2026-07-06T04:04:18.621124Z","submitted_at":"2014-12-20T05:05:51Z","title":"Video (language) modeling: a baseline for generative models of natural videos","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6604","snapshot_observed_at":"2026-08-07T13:10:43.584292Z","title":"Video (language) modeling: a baseline for generative models of natural videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.584292Z"},"links":{"cited_paper":"/paper/1412.6604","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a6e206e4fe47223752761665369fed3f70d5afc50ae65010d5301ae907575d26","observation_id":"454627e6-d7b8-46a8-8f4f-5d3637e20f86","resolution":{"observed_at":"2026-08-07T13:10:43.584292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:10:43.689968Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.689968Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:dc7545610adfb4c25294afda9997bcf592a1892c0936a47de5080f92e0c1a416","observation_id":"633a548a-9fec-4e11-aa6c-8bd1ebd3fa99","resolution":{"observed_at":"2026-08-07T13:10:43.689968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T13:10:43.851289Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.851289Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:129bd8e11ec1e3027d1891cce0c8ddd347b1d8f932f7de7a702cde5b43d04856","observation_id":"9bf018a1-6fb0-448d-b95e-efa4b250609d","resolution":{"observed_at":"2026-08-07T13:10:43.851289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-01T16:38:42.947080Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-07T13:10:43.988173Z","title":"To cot or not to cot? chain- of-thought helps mainly on math and symbolic reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.988173Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e6368a0b6ced0bcd0a6ec2d55176f1abab766070aa369908df57b408a59de6a6","observation_id":"f42e9495-07d5-43ff-a659-14d3113954da","resolution":{"observed_at":"2026-08-07T13:10:43.988173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.435650Z","title":"The wisdom of crowds: Temporal progressive attention for early action prediction","venue":null,"work_id":"cf9cce29-f5a8-4591-9d75-b7b322a24f71","year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.194165Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:c5cf886d5e2ebf606eb96c0f089374e73089543dddfa4954f3c913dac59e8365","observation_id":"e931fd75-e0b7-4087-af4f-9c8819e9dbff","resolution":{"observed_at":"2026-08-07T13:10:57.587779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.360273Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.360273Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:20a488a5dff30826add8d31a12b03deff597ed215820560a4e1e11af89be1ea3","observation_id":"f8ba82e5-fe4e-461e-8d5e-52c2b8254de2","resolution":{"observed_at":"2026-08-07T13:10:44.360273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:10:44.672213Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.672213Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:817e85c74add012afbb73d954bfc559f4420faabf5cd6805d81f3cb65c1ad1de","observation_id":"5465fe51-8e45-4d3b-86f2-106cb8700161","resolution":{"observed_at":"2026-08-07T13:10:44.672213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.830136Z","title":"Generating videos with scene dynamics","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.830136Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:ae6f049fd86f97895b240b45dc2cda5e107ded915a1bfa5d3f51cae67fc30b6f","observation_id":"02023953-c1a5-41ac-8ba0-e57c4663e488","resolution":{"observed_at":"2026-08-07T13:10:44.830136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17703","last_updated":"2025-03-29T15:21:55Z","snapshot_observed_at":"2026-08-06T17:25:43.987350Z","submitted_at":"2025-01-29T15:20:30Z","title":"Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17703","snapshot_observed_at":"2026-08-07T13:10:44.921265Z","title":"Critique fine-tuning: Learning to critique is more effective than learning to imitate, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.921265Z"},"links":{"cited_paper":"/paper/2501.17703","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:7e06951ebc3cc12b878235fb9cec085af8163cb5d688b881df1afc991fc6ea99","observation_id":"761182a1-f92a-4d9d-b1f1-15faf9eef1d0","resolution":{"observed_at":"2026-08-07T13:10:44.921265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.073595Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.073595Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a8e482dcd2766c09d0932381e342248eb6d674ea0cb1192ffa469616800f22d2","observation_id":"2aa31ecd-1b36-4c79-a23a-2fd80ed5d43f","resolution":{"observed_at":"2026-08-07T13:10:45.073595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.125092Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding","venue":null,"work_id":"2e91fed1-b4de-4b5b-ae10-9d918075eaee","year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.200203Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:eadeec78ef7259f4a16ae8156b8545293f8e662d9527a27b6a023cd1927f7480","observation_id":"d84633e9-bfe1-4859-8de3-ad1ba266b0c6","resolution":{"observed_at":"2026-08-07T13:10:57.285209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.325130Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.325130Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8593c4883d99f7feb6058b65c47c64d4b6255dbf6f022ba7675c2c0d09867f4c","observation_id":"7786aaa2-42f6-4983-8025-236172866b37","resolution":{"observed_at":"2026-08-07T13:10:45.325130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.470309Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.470309Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e3c96d18778026af945109a9f00e4ec2227c8ed597ea7419456b72a2abc057cd","observation_id":"c4bdd91e-916d-48b7-8ae6-ba21a585a8d9","resolution":{"observed_at":"2026-08-07T13:10:45.470309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T13:10:45.635718Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.635718Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5b8a5e83f3f61070d00b7e8a9169fe43422e38f360c00fd9e13c71d7ed50b1e8","observation_id":"8f62cfd8-7bdb-4bc1-b40d-e42e352344dc","resolution":{"observed_at":"2026-08-07T13:10:45.635718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T13:10:45.780544Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.780544Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:97ad81ae26af4a977fde85060d19cb6aa801f97ea7feb4126055613861e65cc1","observation_id":"554e8628-ed79-4325-8914-01eb210ef96d","resolution":{"observed_at":"2026-08-07T13:10:45.780544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T13:10:45.965589Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.965589Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:7225c14de85eb3f45977cd9ae98896439295e5369d3a60682cd70b1be0ef194e","observation_id":"154b2e67-dfd9-49d3-8247-306637013fb2","resolution":{"observed_at":"2026-08-07T13:10:45.965589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T13:10:46.144299Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.144299Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e58c7e38bd17fda62fba82d276f6de6ebd8ae60b0bb4e7364c2d822bbcff3573","observation_id":"5065b583-6453-4089-8ddf-b0e1f36b6f9d","resolution":{"observed_at":"2026-08-07T13:10:46.144299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:10:46.365557Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.365557Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:befc1b4c2070d8707b87fe994c6da2d1df2b32c8d4bba24734b43b2db3ad0a2f","observation_id":"3f835619-fbea-477d-a8f5-aa583d881a46","resolution":{"observed_at":"2026-08-07T13:10:46.365557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.817158Z","title":"Achild…”},{Scene2:“Legsare…","venue":null,"work_id":"4f3524d4-7ee4-4cbc-a196-90514f074b04","year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.541780Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2b3a899fe00963cd22efbc3a1f6a874bfd2009dfad5f4096329e210927bf694b","observation_id":"b9a95e2c-c00f-4580-9b5d-6551957c4539","resolution":{"observed_at":"2026-08-07T13:10:56.948195Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.408224Z","title":null,"venue":null,"work_id":"cfbe479b-be26-4c06-8d68-87dcafda18d6","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.784745Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2b97d7d9b7e72d4c9d9c9e57102a3b06a698940752b490ed05f4224ba338719a","observation_id":"6208c882-a1e4-4b0e-bd89-8c07fdcb3b5c","resolution":{"observed_at":"2026-08-07T13:10:56.637066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.149034Z","title":"events","venue":null,"work_id":"e33ac817-fe66-48aa-aa46-a771b7d8542c","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.969026Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b2f298eef9edada037c116d544e1e142e8d0e8274029413e5b0a167b1debcb55","observation_id":"d76ef48b-4255-4107-a1a6-693015df19f4","resolution":{"observed_at":"2026-08-07T13:10:56.298105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.897784Z","title":null,"venue":null,"work_id":"09fb556e-d31c-4135-a037-0370a1fdcb36","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.160274Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a4efb4d006de69b60d6d6b021ed33bbc1fe372a40edf7002b1e612fa16fd8af2","observation_id":"db8aad78-2cee-4390-97f6-b7b146a25760","resolution":{"observed_at":"2026-08-07T13:10:56.014666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.566335Z","title":null,"venue":null,"work_id":"a13bfe12-e862-4035-ba68-e68b17b88f96","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.341401Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:efbef5b1dd3f43713a21ef2c416ce9af8213ccb160194dcb57f632ace7669c53","observation_id":"9ab6bacb-9e18-42c4-8962-c6b42e505ed6","resolution":{"observed_at":"2026-08-07T13:10:55.716992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.243408Z","title":"suitable","venue":null,"work_id":"907ad5fe-6988-438c-8364-8643ddd4b20a","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.485560Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a807edf1c99ab77a32c3a13ba2cfb546d9cf2f282b42e1da357a78206aae3bdd","observation_id":"f597f086-9003-4464-ac15-afa20cba306b","resolution":{"observed_at":"2026-08-07T13:10:55.431653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.951374Z","title":"d e s c r i p t i o n","venue":null,"work_id":"ec7afa64-2491-4924-a955-a8b67720afc0","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.692629Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:eac9ecab8b33b7789a47fc90e7d710521f6fcb2e992d1becdbeca777bf410ba3","observation_id":"92fcad3b-2201-482f-a665-5f0f263ba338","resolution":{"observed_at":"2026-08-07T13:10:55.086036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.711901Z","title":null,"venue":null,"work_id":"93ccee62-82c8-4fe5-a5ef-a8ffa6d64f84","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.902944Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:27c7b3f8b9b81d5f2caf603828a86e380ffe16e216df21f6db1476c2a061a913","observation_id":"65ad7b78-c82f-496e-b895-ac0d179512ba","resolution":{"observed_at":"2026-08-07T13:10:54.826050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.310425Z","title":"d e s c r i p t i o n","venue":null,"work_id":"5a1e738b-9302-450c-83bd-0df347d16b6d","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.042558Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:9deef4fc05e0d0fdcff1c9abc5c7e64c295737a0f8418e017b592215e9fe26b5","observation_id":"3dc27cc6-0011-43e3-9455-e1c67fec9fd4","resolution":{"observed_at":"2026-08-07T13:10:54.512731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:53.946983Z","title":"d e s c r i p t i o n","venue":null,"work_id":"140b348e-5121-43a1-86d2-dbeb7ce257bd","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.174609Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8f53c11aefeae71b98a95aceef0c3a4fc81ee314bfebc2e58b353758a43c1fba","observation_id":"84b3ed2f-467c-4790-8f1d-79d50c88cff6","resolution":{"observed_at":"2026-08-07T13:10:54.188702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:53.456038Z","title":null,"venue":null,"work_id":"e79d3057-fce3-4e57-aaff-ca0fc890af87","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.281096Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:94da21406f2ada7c7a14f21493b7471fe3b43163fb973e71418d9e5a38515d6f","observation_id":"eccaab00-adda-4cac-ae6f-5c2cb4d935ad","resolution":{"observed_at":"2026-08-07T13:10:53.697297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.961912Z","title":null,"venue":null,"work_id":"cccbe394-fd93-4acc-91b9-85c97dafc260","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.488636Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e02b851f523f7f05a5d0d9faf60de4d266265f08d621cfbc26eec52724a2c8d7","observation_id":"1f1cdcd4-1d27-43a9-b28a-efcbd22a09db","resolution":{"observed_at":"2026-08-07T13:10:53.211950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.561826Z","title":null,"venue":null,"work_id":"524d6b7c-8f59-46dd-94ea-4b80c7dc3e1b","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.685909Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5bbd52c63a8aefa9098f635199d8aaf54de5bd12accc0744cc7a574f680d8153","observation_id":"b511f957-3141-4348-bff4-5b1eab709b5e","resolution":{"observed_at":"2026-08-07T13:10:52.783190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.301279Z","title":"C o n c l u s i o n : right","venue":null,"work_id":"ce0c7c65-c5bb-4298-9e5b-163af57fb86b","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.873561Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:82f1e8c093c3963acccf69e0f1c937c0cba4fda7427ec1b2210d770338c8b7a8","observation_id":"22328854-7e91-457c-ab7c-b0555fe4e041","resolution":{"observed_at":"2026-08-07T13:10:52.398983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.103736Z","title":"Question","venue":null,"work_id":"4047b6de-ab0e-47cc-8835-19d822eb4fa3","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.053040Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:943ee85a479f2d44dee39814ee442359619ace1492bc4fd081d551fcf5418691","observation_id":"627e4afa-4a32-46f5-b949-8c9971d99f08","resolution":{"observed_at":"2026-08-07T13:10:52.182869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.909877Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"2ac60cab-e7a9-4991-84e1-f18ede839293","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.269402Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:d68b408ffc6c163a891d60f683354b3ecc81f77040bb4f348cdde5ebb6b45109","observation_id":"ff0e6b85-545b-419d-ab95-d3c6aa46106c","resolution":{"observed_at":"2026-08-07T13:10:52.002985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.763408Z","title":"Question","venue":null,"work_id":"c2b691de-fc8f-4d33-9daa-9547abb238ff","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.416429Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:c4dd7dec39d0870ed14b25d5b5bff364bc02efd9f7348e193aed081f64fc1bf2","observation_id":"13c7557d-d7c2-4d67-b2ab-c3048e22dcae","resolution":{"observed_at":"2026-08-07T13:10:51.837463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.628127Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"5ae101e2-45f0-4b22-bd2c-b48251fdb1da","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.612554Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2702edd74412a2aaf9ed03a558edad1cbd99f6cbf4bffeda51a26ff2ab93dfea","observation_id":"0a22f794-bfb4-45da-bb6b-cda04bf24d4c","resolution":{"observed_at":"2026-08-07T13:10:51.690049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.461606Z","title":"Question","venue":null,"work_id":"5f504671-5f5d-4c47-9f48-4285f3e303aa","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.785664Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:9d0b1277eebd178bd520e939fc0fc934e6d1f57e614de5dfd4297356446bed1e","observation_id":"3e9e1026-edaa-4cd2-b433-e990e86b4565","resolution":{"observed_at":"2026-08-07T13:10:51.549366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.281112Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"8e1dfa6d-e3ff-492a-961e-e140c6dadcfa","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.909121Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:f2b57c7e562dc0815a30008c36e86bce6bc74c13d4fea7a444acfaaabc8b2614","observation_id":"02fa0c0c-327e-4877-86c2-325c0418a7f0","resolution":{"observed_at":"2026-08-07T13:10:51.367016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.071744Z","title":"Question","venue":null,"work_id":"3cb4cd5d-cc45-4166-8427-ec8291db0386","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:50.061912Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:50aca3068fe3076b78f3c3ae031b38cb5688f06f921f1567b7179abc01add87c","observation_id":"aaf58cc8-58b2-43d2-b779-18a2023b4d3d","resolution":{"observed_at":"2026-08-07T13:10:51.201914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:50.833768Z","title":"- Answer options should be built upon the scenes after the observed scenes and before the last scene","venue":null,"work_id":"d8f795a8-f277-443a-b62d-e586a014ad07","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:50.329904Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:93bd2d8082885d0bbac48fff191546e3de6f28f56dcd35908ab7c99c8f2fe33c","observation_id":"26d5b6dc-02ae-4016-a9b7-aec1ff6e3ed3","resolution":{"observed_at":"2026-08-07T13:10:50.917351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 5 inbound Pith citation observations for arXiv:2505.22457."}