{"as_of":"2026-08-09T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c289ec65463c90105a72d4010987c0aed14a1bee625ffb6fec034a34343c1d6c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:32.602468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":22,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:2847b2a649a25ee0253a20296b52a3faaf3219633af72fcb742b3f43b02f2bf6","observation_id":"2c6edefc-924a-4814-96bb-d0ab6ccd99b4","resolution":{"observed_at":"2026-05-11T06:01:53.971264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:b4afb5cc9d1d4464e733700c7b08ed3d0ec539877995cdb8c25d4738909a4e97","observation_id":"de30d0f5-b527-42d3-bfed-85727a24d0ad","resolution":{"observed_at":"2026-05-10T23:20:32.807920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:6cccb9151b8270aa9b9f304e892ba96dca472ea951c1738a68a29537f62fe5a0","observation_id":"64665e60-14af-4d31-81d3-bcfef72206ec","resolution":{"observed_at":"2026-05-10T13:23:58.156138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T14:33:32.602468Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18605","last_updated":"2025-05-24T08:59:28Z","snapshot_observed_at":"2026-08-08T00:45:48.179953Z","submitted_at":"2025-05-24T08:59:28Z","title":"Rethinking Causal Mask Attention for Vision-Language Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:32.602468Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.18605"},"observation_digest":"sha256:2367e9eace2c32b85568a3c26a2ed3cd905b3cb135527b30ddc5a4581fffea99","observation_id":"062db950-583c-4fbb-871d-02d519762ad8","resolution":{"observed_at":"2026-08-07T14:33:32.602468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T12:40:46.242481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-07T12:35:51.712975Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.242481Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:c41e7d4f675413fd82c7a2337b2060b27a3d50a784d8d360b3b05f26ae83f85e","observation_id":"7ee1a5e5-7b2c-498f-90ae-a196f9785ab4","resolution":{"observed_at":"2026-08-07T12:40:46.242481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T12:22:13.702673Z","title":"Star: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-07T12:12:19.396965Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:13.702673Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:57a5d1d11518f44b161a1dc7a31218f56a3752e30689f51970606e58d52bc1b1","observation_id":"b23e32ea-f4c2-45bd-a21a-5b55d020807b","resolution":{"observed_at":"2026-08-07T12:22:13.702673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T11:29:29.288871Z","title":"Star: Structured action understanding in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.288871Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:da15b5c82ae850729ad06be3a5f13ae5ebeacc22712c8a6807e350cb5bed3aff","observation_id":"759cfd64-7b93-4d6e-9e2e-1b9fa7556250","resolution":{"observed_at":"2026-08-07T11:29:29.288871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T05:49:53.357596Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.357596Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5524d75907c8f02e0cd24df9de60117c05d71c1e2e7bc34d3e746cddedf8558b","observation_id":"28fd6f61-85cf-4000-9df3-5bdea4755f80","resolution":{"observed_at":"2026-08-07T05:49:53.357596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:54:24.595020Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.595020Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:d6f3a4a30f917c637f55bad73bf958ce6ed13f24df7e5f12b3f28a15c54ad281","observation_id":"b0beb357-0bc5-4803-9b93-2e37a27c3837","resolution":{"observed_at":"2026-08-07T04:54:24.595020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:22:56.051254Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.051254Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1089224d1e7839727df151610f47d42ced0978f0980e79366926fba78dc9348f","observation_id":"9a8e578c-f3ed-4db6-b45f-5eba1d035eca","resolution":{"observed_at":"2026-08-07T04:22:56.051254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-06T22:37:39.190020Z","title":"Star: A benchmark for sit- uated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:39.190020Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:e95c6eb63a902dc116c1e9224353946ed50ffa6d632ea266deae7acd695bafe1","observation_id":"9fc06ce8-f3a8-4ffd-a395-9a0bd9cf8611","resolution":{"observed_at":"2026-08-06T22:37:39.190020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-06T15:53:53.840655Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14743","last_updated":"2025-08-28T16:45:48Z","snapshot_observed_at":"2026-08-06T15:46:43.525287Z","submitted_at":"2025-07-19T20:30:43Z","title":"InterAct-Video: Reasoning-Rich Video QA for Urban Traffic","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:53:53.840655Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2507.14743"},"observation_digest":"sha256:3505fbfe63deafc93e4e3d9c12a58ee0db2e6995157bdb731be0be7cb04ae0ef","observation_id":"fd965cf1-4793-44c8-9b71-6bfdcfe742e1","resolution":{"observed_at":"2026-08-06T15:53:53.840655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-04T13:22:35.455844Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.455844Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:01f7fce953f4fcdf2b78825d26739d99d53f83d07c2b461fd81a19ebe1ff978e","observation_id":"bccc7492-cf70-4dea-a402-134cf0aea9e6","resolution":{"observed_at":"2026-08-04T13:22:35.455844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-03T20:23:07.271934Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.271934Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:8f762446fcc627d6639ad27de46a4ff78a5582e06d1bef6c0dfc3d4219466647","observation_id":"905837be-2b9a-4bfc-bfc4-713a1d332ae9","resolution":{"observed_at":"2026-08-03T20:23:07.271934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2512.23292","last_updated":"2026-05-20T15:48:38Z","snapshot_observed_at":"2026-08-01T23:47:11.303976Z","submitted_at":"2025-12-29T08:26:27Z","title":"Agentic Physical AI toward a Domain-Specific Foundation Model for Nuclear Reactor Control","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:19.490074Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2512.23292"},"observation_digest":"sha256:a3e88d95f678082ad528e881bb65be665cc2e873ffdcb69cecf04769b877bf26","observation_id":"735132a7-13bc-4a9b-b53a-e64c0780247c","resolution":{"observed_at":"2026-05-21T17:00:24.028688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-03T11:13:16.935561Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-08T14:41:26.174719Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.935561Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:bc0af82278d170939157612122024da0ad32a63dca0370c8ee2a52cd2d7af8e5","observation_id":"120f12dd-3a86-4f5d-9f94-c11e9fbba5a2","resolution":{"observed_at":"2026-08-03T11:13:16.935561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:d79df9f7a9f90e9b424d7b5dce9935dc8e0134a182c78ab3a628017ffc27722e","observation_id":"66a596ee-822f-4326-9cc1-e40f7e93a353","resolution":{"observed_at":"2026-05-14T22:08:04.316200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:95ec5727c1f924951b8d66cf792de8a80fb77e3de3b068554b275672159a537a","observation_id":"cc5e434d-a353-4b6b-8158-55286c0d98ed","resolution":{"observed_at":"2026-05-10T23:15:50.112085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:ac1e4c6606381a24b3aeece0c61cda753f8ccea806fd528ce91ae2f42cdd2e22","observation_id":"123b9b79-0ab7-486c-a028-10ec04398d9d","resolution":{"observed_at":"2026-05-10T12:05:22.204503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:7b6064c82c626ab541736c64ad49f975ae016c94953443df2c0d59425d61ab3e","observation_id":"1ed24a58-b4f4-4690-898a-625f32d58e0e","resolution":{"observed_at":"2026-05-19T17:37:41.709145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.08452","last_updated":"2026-05-08T20:17:44Z","snapshot_observed_at":"2026-08-02T11:51:01.160947Z","submitted_at":"2026-05-08T20:17:44Z","title":"NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:23:04.253007Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.08452"},"observation_digest":"sha256:9615c7244590626743b4ad52edbe69dfb758fcc3b338af9dc806e027cedb5c24","observation_id":"5aa56276-6bf3-47d2-9082-8289ec639140","resolution":{"observed_at":"2026-05-12T07:41:31.979277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09874","last_updated":"2026-05-11T01:59:59Z","snapshot_observed_at":"2026-07-30T14:13:44.494421Z","submitted_at":"2026-05-11T01:59:59Z","title":"EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T04:37:46.090777Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09874"},"observation_digest":"sha256:768b2344536917ca7f3b7b4d1e8f74c8eec31c761e26b7726238bdaa08beed30","observation_id":"fb947a5c-c059-4932-a558-f2947109e8d2","resolution":{"observed_at":"2026-05-12T06:06:24.536554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:c68c6c2bb71405b6ec87249623c53b2433b86051581c77afde348df58e342818","observation_id":"f67abafe-e20d-4377-87db-50dc8928964e","resolution":{"observed_at":"2026-05-12T06:31:26.645656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:5602a84a28daf7e8ae091bed54a18ba2934f6feb41cc35c746d351384fe1d2ec","observation_id":"3da4fe23-a46b-445d-9362-f21ccd5487f8","resolution":{"observed_at":"2026-05-13T06:57:28.352513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-08T15:14:20.631028Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:a641d57829979ecc6105e685f3e4ee356bfdc04053a5580632532f72c81b56b5","observation_id":"15ac86a5-8aaf-41b1-ad16-b6159506d969","resolution":{"observed_at":"2026-05-20T14:48:23.101517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:1c84d580c5e8939eacba610a8d9075a781286fac03bfa3cadf88f76d2fe88196","observation_id":"27867a6f-0e53-492e-93be-22038c983a16","resolution":{"observed_at":"2026-05-22T07:21:12.820432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-05T09:42:53.562841Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:36df784344c192cf2c2fa74c7bca028e72499d54a82a49b0f753cda054e5a6dd","observation_id":"0e77163e-16be-4107-86bd-f14845461c73","resolution":{"observed_at":"2026-06-29T18:23:50.384160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.06338","last_updated":"2026-06-04T16:12:43Z","snapshot_observed_at":"2026-07-06T23:46:10.612537Z","submitted_at":"2026-06-04T16:12:43Z","title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:47.810096Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.06338"},"observation_digest":"sha256:07bd653e249e111eba00f5bd2345569b0484063972420f4b98763809c9fc7968","observation_id":"f6646ba2-5194-4238-8731-f1f8dca3350d","resolution":{"observed_at":"2026-07-02T12:26:57.200530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:a0f74587da4270ee3d7bdde691ff35e9574e48915bc293e0792280294e27d8b3","observation_id":"a0677d9f-3162-40e3-93f3-a10432fe406a","resolution":{"observed_at":"2026-07-02T20:27:22.643440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-04T14:09:28.537223Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:710ecca6957089442080e53c4cf90d39d58980abbb7c4d67935d2e450fd2b237","observation_id":"c14895da-190b-4922-aee1-fe6cb16ea015","resolution":{"observed_at":"2026-07-04T19:30:08.033476Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T04:07:52.232959Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:316662775238e22877453246230161a12a4c75a04daa3e791b3a196e232aa609","observation_id":"ae2fc7de-4929-4e7f-91f1-86a672fb19dc","resolution":{"observed_at":"2026-07-01T17:15:50.640611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T09:53:49.542693Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:cbc151931e7f75c1cd4c53016c398a4b86ca612dd653644135b2c31e0e8d48e7","observation_id":"735146d8-3a12-4ed6-b5a0-2d2961f19a2f","resolution":{"observed_at":"2026-06-30T09:54:34.485078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:47.324684Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:85e100629f5833e3d23d8102b7c28a05df4cf2eaba26d855e60fdf9b9aa3bc10","observation_id":"80288e54-4781-49cd-ad48-7730585a28a2","resolution":{"observed_at":"2026-07-01T09:05:37.282597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27999","last_updated":"2026-06-29T10:15:53Z","snapshot_observed_at":"2026-08-06T16:35:46.841389Z","submitted_at":"2026-06-26T11:52:37Z","title":"HumanMoveVQA: Can Video MLLMs reason about human movement in videos?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T04:53:11.830488Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27999"},"observation_digest":"sha256:07b3292ea44b0a7202fb223316acc7a2eb4009dc427802cecc3a549e6f939c8c","observation_id":"13711394-58a0-4b2c-a88a-453d55d6f546","resolution":{"observed_at":"2026-06-29T19:13:53.048614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27999","last_updated":"2026-06-29T10:15:53Z","snapshot_observed_at":"2026-08-06T16:35:46.841389Z","submitted_at":"2026-06-26T11:52:37Z","title":"HumanMoveVQA: Can Video MLLMs reason about human movement in videos?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:56.063333Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27999"},"observation_digest":"sha256:bceefd713acd99fd8d559f80caa25642fd3c39d2bbcc9306f4c114d721283130","observation_id":"0978f925-f5ae-4cf8-97a3-fee8566e1573","resolution":{"observed_at":"2026-06-30T09:54:35.318699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:08fe895e87325e9a19a0a308720ac96d4d8115544cc4c34f2e8c6ce6727e20e4","observation_id":"a4642844-0455-4f73-8e94-04cae7b4956a","resolution":{"observed_at":"2026-06-30T06:24:19.569669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:389efb9165e8db6183fce4a2141614804a0613ba2bd381da03edfb849c9a9bc8","observation_id":"6bf62ec9-5422-40a6-9e7f-ff5da6e0f4dd","resolution":{"observed_at":"2026-06-30T06:34:19.497431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-01T22:45:07.891633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15641","last_updated":"2026-07-17T05:34:29Z","snapshot_observed_at":"2026-08-07T08:48:58.437566Z","submitted_at":"2026-07-17T05:34:29Z","title":"IMBench: A Benchmark for Intuitive Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:45:07.891633Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2607.15641"},"observation_digest":"sha256:af0e67383831c9e2c9f694d4164621c6f8a293c6900e2793a3a3d2c1a2aa5563","observation_id":"88dcadad-d535-4981-8826-bc546bb0920b","resolution":{"observed_at":"2026-08-01T22:45:07.891633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.09711/citation-record","integrity":"/paper/2405.09711/integrity","json":"/paper/2405.09711/citation-record.json","paper":"/paper/2405.09711"},"outbound":[],"paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2405.09711."}