{"as_of":"2026-08-05T04:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:267b74c2d76da09e20147f5739033f1bc3830a956ccad015a851775e2453d31a","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:04:21.463842Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26014/citation-record","integrity":"/paper/2605.26014/integrity","json":"/paper/2605.26014/citation-record.json","paper":"/paper/2605.26014"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Temporal chain of thought: Long-video understanding by thinking in frames.Advances in Neural Information Processing Systems, 38:143018–143046, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:9300c6331bb6aaac30be8fa37f5121b0358fa136f85fd454e163198cfd6d4724","observation_id":"8ed27c2f-2875-4f32-8273-05c7e910d6a8","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:fb9db639152f60deb5e178641b4e5aa9e8147c12cc2ea6393face4d799942180","observation_id":"bf37c793-386e-4fea-b83a-403cc00ca777","resolution":{"observed_at":"2026-06-29T23:14:02.149530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Perception tokens enhance visual reasoning in multimodal language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:dc9985a103630b26b32780d00160894373a4413fd84f824103c358a5db32b766","observation_id":"0c1e0b0f-925a-4f91-ab34-0410f6dc74e1","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:17:48.585298Z","title":"Spatialdreamer: Incentivizing spatial reasoning via active mental imagery.arXiv preprint arXiv:2512.07733","venue":null,"work_id":"3192694b-f5ea-4f59-b92f-b90ddef8ab4e","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:c63d061085eb7ee21beabb57cde30924cd6f82c9d923b372d5c71365494c555a","observation_id":"b85823d2-4229-4e84-be95-744a3e30e6d6","resolution":{"observed_at":"2026-06-29T23:14:02.145445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models.Advances in Neural Information Processing Systems, 38: 91077–91100, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:ed9379340921d3e5f86280a313883a3e238008c5b9e50ceaf8fa95f81553e70e","observation_id":"5e002077-db44-4bd0-b0da-84e45fcd9f89","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37: 19472–19495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:d6ac82fa9e2a397cb394aee84fb7dc2d12bee08419cf230c54cf5efeb0c8efbe","observation_id":"97e283d9-d204-441a-8743-5cce1de4df21","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-01T16:24:28.120659Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.21374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-07-04T16:39:58.338552Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","venue":"cs.CV","work_id":"6d26f54b-33e5-4b18-86b0-7202ab41b867","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:b4b43b20be5c50b2fa9ccde133332bbaadaa14368da44720e946863ba8780ef4","observation_id":"99d72b92-c5eb-4d43-9246-24b882d50954","resolution":{"observed_at":"2026-06-29T23:14:02.175936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:103cb72e2919bab67ea3b1f15c7481b5df8fe7df0e4f86417a7850f9655c3624","observation_id":"b86c6586-2eb6-4d46-bb9a-5bbd73d411ec","resolution":{"observed_at":"2026-06-29T23:14:02.194371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Don’t look only once: Towards multimodal interactive reasoning with selective visual revisitation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:9fe4b871e8b7f155cc6e613e57d42cefa8a720460cda0073330fc2fec58915ca","observation_id":"840b73b0-a587-498c-af76-e3de316843fc","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":"2405.14838","doi":"10.48550/arxiv.2405.14838","metadata_source":"pith","pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","venue":"cs.CL","work_id":"70541c9d-c3f3-48e4-be00-e7de1622f612","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:574ea5db7e4f6b38e7cf65bb6e72126e3c7d8f7bc73f5c6d4f7ca1735d0304e2","observation_id":"a945a249-5493-4350-9b7c-7b8188b729c7","resolution":{"observed_at":"2026-06-29T23:14:02.196716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-07-06T19:05:49.062452Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":"2408.14023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-07-04T09:39:46.765108Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos","venue":null,"work_id":"2ed72cbe-f6a7-4149-911f-be5ff9cb6d0e","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:25f3bd81a4af4fa0f446fd5b9a5421a58c599326bc7600046c901c1f95e6d8dd","observation_id":"433ae2e0-4eaa-49c3-a4f7-36f6b24270f2","resolution":{"observed_at":"2026-06-29T23:14:02.202123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Video-r1: Reinforcing video reasoning in mllms.Advances in Neural Information Processing Systems, 38:99114–99137, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:dc829a1b47f7338f8861bf1173212b85fefd7912b16d91bfef52d025987ca094","observation_id":"e9e022b0-0a57-49d8-8b19-8f615fb6a7ff","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:e7d333115184d705d16e0d03cd25ccacf1e9acd57f4df27487f7fa91c6f5b8ba","observation_id":"f6da11c3-3a5f-456f-97e3-52fb17e41955","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:8ae5b3db015152e5e915be7a6ed08b53201cee910a23fe55ce54e34cf7e862ef","observation_id":"ff3ce45b-1a70-4467-8747-bcdd131ac89b","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-07-06T20:18:53.977126Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:863fd4a4491bd3b09b284d69f0df717bf99993fe7a8cd41a2629f62fc4b9bdcf","observation_id":"c0f0b526-4d84-449c-935b-dc8265e2006d","resolution":{"observed_at":"2026-06-29T23:14:02.204792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":"2506.00318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-07-02T17:27:15.716678Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","venue":"cs.CV","work_id":"9208ed98-514d-40a0-901a-15cd610da796","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:9c45032a2a89b39e0348f19e5257a6d83cfd774a7eaea1cda163febe36f2707b","observation_id":"3e5b7e4b-668c-4e5d-8a96-d687ad83697e","resolution":{"observed_at":"2026-06-29T23:14:02.209910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:58bc1173e34493a9fd95677ce41ad7fc8ff81191b16fb62ffa10830dcd87ac1b","observation_id":"073c46b2-b814-4303-beb5-490553676874","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:972eedda1965b54307039ee119583027ac17fbbe86087101eba4732e77440769","observation_id":"93c599d7-8362-4486-ad1b-21a4216a95c6","resolution":{"observed_at":"2026-06-29T23:14:02.212178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:3f38ac4d07f2b0d911756276dc31683b114aa2067144b7c780991464d942d0f3","observation_id":"42cb633d-a214-4ce6-8196-39810dab466d","resolution":{"observed_at":"2026-06-29T23:14:02.173451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:14:02.215811Z","title":"Visioncoach: Reinforcing grounded video reasoning via visual-perception prompting","venue":null,"work_id":"cd789152-a6d0-4c5c-94a6-ce49bfcda249","year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:6f96692ef2c2951b0b3c39d88c1525de99e58049eaf81035d9ee0277eb04c1e2","observation_id":"1ef76558-25a3-49ae-9f1e-11e85ca42551","resolution":{"observed_at":"2026-06-29T23:14:02.217378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2509.24251","doi":"10.48550/arxiv.2509.24251","metadata_source":"pith","pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Visual Reasoning","venue":"cs.CV","work_id":"b6468cfa-4f13-4e02-b0ec-24ff5cd6785a","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:501fb65b2ae2093d008040fd2d05ef5e4302f41c1cbfc89ad15e2ae370890694","observation_id":"d5405cfb-5c63-4d27-9add-07cf6554e9df","resolution":{"observed_at":"2026-06-29T23:14:02.147369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:def70efa9638c38744363439c3a5d80bcc0e21aa371c9f3d7ebb60c9fb922a5c","observation_id":"d710614a-dad6-47ca-946a-6920d15a98f8","resolution":{"observed_at":"2026-06-29T23:14:02.219580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:94d1f15c00c79ff1bba69a9411614f63af34e209fac98e8a10243ea8aaa2c053","observation_id":"645d133c-f232-407d-ba77-d3223737a921","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:6c722d1c46810807baf7de7a08ec83b9c42d142e9bb8ce5ab1ef39f90a866213","observation_id":"f02789d4-5c79-4d0c-a9e8-0c09eab6fb0c","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Univer- sal video temporal grounding with generative multi-modal large language models.Advances in Neural Information Processing Systems, 38:64426–64455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:2fca3c5b5a08c60dd07972e54a9f9f1bf439b3095277ce209ee8290b65abb23c","observation_id":"edd91668-ed11-4a1e-ae09-d4c4bc76fcc5","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:9020c8c9d784605ada02f87f280edf8b5ea2c536633c48c87727b547344b8848","observation_id":"8274f1bf-9d38-489c-b2d1-edbcafc5c3fb","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Kangaroo: A powerful video-language model supporting long-context video input: J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:5d2439c674582994dd1a97cfa079167ef87db494a522aed2b5896876061084b9","observation_id":"1d6f08e3-5618-4a3b-aefe-2db9a49e015e","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:2558e5ae8587b211d9fd614b2c0c5b7cafb541acc76c7fa0821c3a4451f0c612","observation_id":"b1dff096-465c-41be-8138-8c7d113fa18c","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Tempcompass: Do video llms really understand videos? InFindings of the Association for Computational Linguistics: ACL 2024, pages 8731–8772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:449b1d48dc06d0d65e966813366bcac87fb81014f1147714a3f709dc529398f0","observation_id":"18d1a293-f65c-42d7-9f0b-7ca651a906cf","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.649286Z","title":"Sat: Spa- tial aptitude training for multimodal language models","venue":null,"work_id":"bbf5f212-8e91-4bac-9e1c-ba1d133bfc4c","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:20aefeb40f1fd93f3ed3f3896ac5cee5f6eb1bee84d2636f1fbb41dbca1f1294","observation_id":"332ffb27-fe4e-4210-90ae-dd15b2a82d4d","resolution":{"observed_at":"2026-06-29T23:14:02.222058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-07-06T22:38:45.907386Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"cited_work":{"arxiv_id":"2512.10941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10941","snapshot_observed_at":"2026-07-10T13:37:06.836665Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","venue":"cs.CV","work_id":"a831fe1f-0927-46d3-a512-9e9b3a906248","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2512.10941","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:351e9bd18506ecd996175a6013fef2a9d966df499b1f99f66b8ac0a83fb80afc","observation_id":"41d7a7ef-7ca3-465a-86f5-e44bb5d11d83","resolution":{"observed_at":"2026-06-29T23:14:02.171278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a6f75d87aead731360440e96a5660014bfd99dc9dedcf14c62103b3a39843624","observation_id":"6c74e4bb-7fa0-49cc-8719-d908b62f7470","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Codi: Com- pressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:3d7b6523532093440a01a2c2da32ff2e6cc2c6ce7547bc673f3a8bc47ed39d20","observation_id":"cb8d4dc2-4bbb-4abd-86f2-da6f4089aa39","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:88da9c7df64f447a98e057550bb3edaba5a79703630aebea9d1c8307c329371b","observation_id":"dff17e02-9429-4880-ae5f-d28a82840e38","resolution":{"observed_at":"2026-06-29T23:14:02.183555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:6ea1d7ac4bf34abcc6ce9c633da4ea1ffeeb645df2248ec747dc9764fb3298e9","observation_id":"d315af14-af7f-41a9-bce4-ba2f5d1b03f6","resolution":{"observed_at":"2026-06-29T23:14:02.164050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23473","doi":"10.48550/arxiv.2510.23473","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-thinker: Sparking” thinking with videos” via reinforcement learning.arXiv preprint arXiv:2510.23473","venue":"arXiv (Cornell University)","work_id":"f6e8a985-4856-4397-9f14-221421fd639b","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a0b0a2c13fa5c0e93f43141b0d071a92f43dfd87e2767d427439ca2fd376bb55","observation_id":"1951b92a-731d-4d5f-a925-63c395ab0937","resolution":{"observed_at":"2026-06-29T23:14:02.169937Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:7ac05f3790c722b3dc580fb5073bfe40c1166c69c2b1057860ae61ca555c0b12","observation_id":"ddbca35b-dfde-45b2-972f-4b90e20b0f71","resolution":{"observed_at":"2026-06-29T23:14:02.182899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.02889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.752891Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via hybrid architecture","venue":null,"work_id":"c93e268d-1703-46de-8123-15c73f06bc0b","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:f974d618afd4ff3715a0847c59cd3b40f3c3cf8368928a9e7a7ee6df366c643d","observation_id":"50133aa3-2b10-46ab-a869-f38dc07a5318","resolution":{"observed_at":"2026-06-29T23:14:02.180351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Time-r1: Post-training large vision language model for temporal video grounding.Advances in Neural Information Processing Systems, 38:83330– 83364, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:cfb6d35f005ef72114c1e93c445615ef474413cafb82505cde033f56b2198481","observation_id":"df04e209-d8c1-4065-b552-8939cfdf5654","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01863","last_updated":"2024-07-02T00:24:01Z","snapshot_observed_at":"2026-07-06T18:40:01.321429Z","submitted_at":"2024-07-02T00:24:01Z","title":"VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs","version":1},"cited_work":{"arxiv_id":"2407.01863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01863","snapshot_observed_at":"2026-07-04T08:49:42.284484Z","title":"Vsp: Assessing the dual challenges of perception and reasoning in spatial planning tasks for vlms","venue":null,"work_id":"860f68ca-a61a-4b00-b02c-2c4753864d32","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2407.01863","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:c3a0cdb4d0704799d6b512e0c11068909974485e72f5902ccdedb1b9e48f7a53","observation_id":"01f1fa6a-fd3d-433a-b2fe-8e7a4b3444c4","resolution":{"observed_at":"2026-06-29T23:14:02.214718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":"2404.16994","doi":"10.48550/arxiv.2404.16994","metadata_source":"pith","pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","venue":"cs.CV","work_id":"8949d4db-20f2-47c1-83a6-fcbe041b62ef","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:0bb83c7ee8417804931a75618c55fc38ee2dcc3b4c736b83bc07ad8c82e072f8","observation_id":"d1fd8fbc-7905-4148-a208-f46299698392","resolution":{"observed_at":"2026-06-29T23:14:02.214187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18943","last_updated":"2025-03-27T17:34:06Z","snapshot_observed_at":"2026-08-05T03:24:45.713479Z","submitted_at":"2025-03-24T17:59:07Z","title":"SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":"2503.18943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18943","snapshot_observed_at":"2026-06-29T23:14:02.175777Z","title":"Slowfast-llava-1.5: A family of token-efficient video large language models for long-form video understanding","venue":null,"work_id":"3ed88f06-c54e-4be9-b2eb-1a4ae1bb38a5","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2503.18943","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:4a3199047ce1899979bfa0899e222ec39a24b78e1958551764c3e06a7461e9d3","observation_id":"9c8bb1ec-0283-48c4-9bae-2a968b2deed9","resolution":{"observed_at":"2026-06-29T23:14:02.177596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.958436Z","title":"Visual planning: Let’s think only with images","venue":null,"work_id":"de8a30bf-f8d1-46d8-b619-a8e07a7503cb","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a120e4ae11188bd0d352201f307c6c5a151f12e82a6e4175da6f733ca4e226cd","observation_id":"314c3d7f-4428-486a-a4bf-aa89d081ac11","resolution":{"observed_at":"2026-06-29T23:14:02.201167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:b662f898017777c31d72dc643392a1bec55f35604ec64f90685d80ae9ef8fe49","observation_id":"53f5bd53-bb66-4f09-8a9f-ce94ab1daed7","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:9c8dd69856921192a5b091e2319afb19cd67d2d737ecb895701398b11c389687","observation_id":"ead86fe9-3639-44a2-b16f-34c923b51c50","resolution":{"observed_at":"2026-06-29T23:14:02.161748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:265efc1dd21a50d6017657dce6d13fb498ead03aebbd0719d56eedbc3325d280","observation_id":"0263200f-4e1f-4d9b-ada5-12bf700c67d1","resolution":{"observed_at":"2026-06-29T23:14:02.218728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":"2511.20785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-07-02T23:57:29.009867Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","venue":"cs.CV","work_id":"18448f92-5a5c-48d8-bc8e-62464eb1c501","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:de6e8f87f1fff1a7385626962a41470c047e193f7f60bd8957be76ac9e005616","observation_id":"f2a19d64-227e-4966-b2e5-461947f50484","resolution":{"observed_at":"2026-06-29T23:14:02.223873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08236","last_updated":"2026-05-31T23:44:59Z","snapshot_observed_at":"2026-08-03T03:25:11.411186Z","submitted_at":"2026-02-09T03:21:48Z","title":"When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2602.08236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08236","snapshot_observed_at":"2026-07-04T13:59:51.783600Z","title":"When and how much to imagine: Adaptive test-time scaling with world models for visual spatial reasoning","venue":"cs.CV","work_id":"a6ffefb4-09b3-486d-856d-e3aaf4c60e32","year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2602.08236","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:8bd1d155a551e7526d673b789c3289516e57b0484e38d5d129cf9b5438043c2a","observation_id":"38255bd4-f7fe-477d-9ada-8fbd9b4543a5","resolution":{"observed_at":"2026-06-29T23:14:02.224535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a34ae7ecea3dead94c16bbf242130065debe42dc3630ae46a29af08be2fe07da","observation_id":"95dfcfab-c8d0-40bd-b52d-892e0696a4a1","resolution":{"observed_at":"2026-06-29T23:14:02.207358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:37d0e7b64d92db552694f81f2c33f0659081641cebc703c0be7dcf30522e0b57","observation_id":"69750faa-9f81-4477-af30-ff24fbcc021e","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:ffa5fe646271720bf71aa9af76d8f6077c6063acd3c4d06b564fc431e5ac07ab","observation_id":"50b57f9b-3c25-41b3-b925-5308d6dd85f8","resolution":{"observed_at":"2026-06-29T23:14:02.186158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Chain-of-focus: Adaptive visual search and zooming for multimodal reasoning via rl.arXiv e-prints, pages arXiv–2505, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:8a940adfcbb565d104df42207823a99ba7a971d18b730356dc0efcc5bf9eacc0","observation_id":"0c8ae7cb-59e4-4584-96dd-08dfbfe59926","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"LLaV A-NeXT: A strong zero-shot video understanding model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:ade9aa5b5f2074b63daf95a07d0ec3001643bbc7efe0433b22c319a5104878eb","observation_id":"12f59734-c3e1-49ce-8718-91decbbbff57","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:6180f3c86ab6b2e2e88204698a5853dfa65babca28d4183da5b5622224832101","observation_id":"2c177a1e-5681-4bd1-9c71-71475485eaec","resolution":{"observed_at":"2026-06-29T23:14:02.193248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a666c122925195fb310a6d51967498a70a01b38e3a5f8c8865002141d4386419","observation_id":"4e7eda27-9a17-4d93-9a2d-9fef7b857d41","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:21.463842Z","title":"Reagent-v: A reward-driven multi-agent framework for video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:fda4b54253dcc0159a5eee9d427f864653e13a1ea164633a522168587e6df562","observation_id":"e5b7ce6d-fd73-4a12-bb8b-fd4f47701776","resolution":{"observed_at":"2026-06-29T23:04:21.463842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:56:59.313425Z","title":"Emergence of superposition: Unveiling the training dynamics of chain of continuous thought.arXiv preprint arXiv:2509.23365, 2025a","venue":null,"work_id":"06f9f980-41be-48da-9ce1-9d51bd61f4b8","year":2019},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:7968ddf9194f2b33d05b98f164b133342f0ad5a9e320baca3e745f293761b171","observation_id":"20a589d5-7cdd-473f-a8e3-412f1d2b8dfd","resolution":{"observed_at":"2026-06-29T23:14:02.172467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:a9c05c63981e22f17bc238d954352b8ce30ad1190886c058ef1668ab064c439f","observation_id":"5e282e05-9ddb-4dc4-a4db-147600d69eb9","resolution":{"observed_at":"2026-06-29T23:14:02.178567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":32,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2605.26014."}