{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:855f37aaa4455c0e86d381e65aef637c2b45f768bb19a756d38b314db86dcce5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:27:47.145067Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02807/citation-record","integrity":"/paper/2509.02807/integrity","json":"/paper/2509.02807/citation-record.json","paper":"/paper/2509.02807"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T11:27:47.077290Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.077290Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:d659715278326880444f3c593644fabeaac86490ae7c8c1a1cb42634d2646f39","observation_id":"4018e7bd-4846-4503-be68-928453b8ea2f","resolution":{"observed_at":"2026-08-05T11:27:47.077290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05930","last_updated":"2024-09-17T02:10:16Z","snapshot_observed_at":"2026-07-06T15:14:55.628493Z","submitted_at":"2023-04-12T15:50:19Z","title":"MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer","version":3},"cited_work":{"arxiv_id":"2304.05930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.05930","snapshot_observed_at":"2026-08-05T11:27:47.515908Z","title":"MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer","venue":"cs.CV","work_id":"18525668-89b5-4c48-9ed4-d1769a375b52","year":2023},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.082104Z"},"links":{"cited_paper":"/paper/2304.05930","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:158868c52fa217092c2a7fe7145f1baf93e675a8b4dbd66361805e833d3c7861","observation_id":"2c9655e2-ebaa-4cb8-84bb-095876763e1c","resolution":{"observed_at":"2026-08-05T11:27:47.523163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.597466Z","title":"Visual instruction tuning","venue":null,"work_id":"3f9b0391-32bb-4169-8a9a-b24ecf9f50b7","year":2023},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.092352Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:f0083b0633d9e7044370127ec250775810eef97a0b90c67a452381f5a298eb0e","observation_id":"004ce299-6190-41c0-9871-e2cded83df37","resolution":{"observed_at":"2026-08-05T11:27:47.602290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T11:27:47.097393Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.097393Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:8db65990bde40eb7d960a05ca7820ed12e1fbcc189d022b2b44a7d6d3e040c42","observation_id":"eba6ded5-0332-4278-a22e-9cfa58f8dd31","resolution":{"observed_at":"2026-08-05T11:27:47.097393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T11:27:47.106806Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.106806Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:cc8bedea9bc265eb2b9c248c36b1948b2e4a6d5b8823c3a7e9287f10c234a1ae","observation_id":"cbaa8710-72bb-4e3c-b023-83dabb5b3358","resolution":{"observed_at":"2026-08-05T11:27:47.106806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T11:27:47.111735Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.111735Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:e105fc39d0f4fa65ec662e613761ce8dd05e8db8a0d613c80eef4fd360f6435f","observation_id":"b6705038-e826-46a5-93ff-615f14bea5d4","resolution":{"observed_at":"2026-08-05T11:27:47.111735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.126396Z","title":"Seeing the arrow of time in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.126396Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:430cc611bbd927177b39be90e468e239fb4ab06bad0bd15bb7a07f5a786fdf1b","observation_id":"85c6c5a5-706f-4501-b376-a90ea40fade8","resolution":{"observed_at":"2026-08-05T11:27:47.126396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-05T11:27:47.135264Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.135264Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:7cdccba9a28560442a6557ec5dbd93028053c7f987c70ffeca9c5944df1e90b3","observation_id":"06762684-0978-4228-8d19-64855a174207","resolution":{"observed_at":"2026-08-05T11:27:47.135264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T11:27:47.140036Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.140036Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:7ebe06d3159d6c5cb1b755ad1e86fcee3fe0b0c44281a48b0fd24bfed109d6d5","observation_id":"48401b11-edf3-420b-9e40-32acd7052281","resolution":{"observed_at":"2026-08-05T11:27:47.140036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-05T11:27:47.145067Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.145067Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:a60e3282346421d964af56b777e52a26f18ddf1bd89a33234b29ee8476e0f22a","observation_id":"4ebc1d82-7cb1-49f5-9264-9aaf78b8426d","resolution":{"observed_at":"2026-08-05T11:27:47.145067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-05T11:27:47.130766Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.130766Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:0de44d1bc4ce77aa2c2ad7689e18d854950973d55371f7f7a6cade2ae7fe41d3","observation_id":"6e33aa3b-2862-416a-ab2a-c549c15742d1","resolution":{"observed_at":"2026-08-05T11:27:47.130766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T11:27:47.086884Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.086884Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:1837dc840c206d6079240906a4fe8a885b9b729ca55a367613f2d62054524fa4","observation_id":"95e3f717-51cf-4246-8c63-32409f313d6f","resolution":{"observed_at":"2026-08-05T11:27:47.086884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.117264Z","title":"Pixfoundation: Are we heading in the right direction with pixel-level vision foundation models? arXiv preprint arXiv:2502.04192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.117264Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:edf626d930ac2ea171a55f4704aac2cc461dd8c7d65d1ccb6b1def25e547bebc","observation_id":"517b939d-d764-4c18-9746-ecb1f30d78b0","resolution":{"observed_at":"2026-08-05T11:27:47.117264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04923","last_updated":"2025-03-25T10:08:13Z","snapshot_observed_at":"2026-08-04T02:03:57.818642Z","submitted_at":"2024-11-07T17:59:27Z","title":"VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04923","snapshot_observed_at":"2026-08-05T11:27:47.102050Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.102050Z"},"links":{"cited_paper":"/paper/2411.04923","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:8af3b6c9b6773a2425c147f0389e874157d14ef48ac7c6a824dbd8683fa2623f","observation_id":"f13312fa-4a4e-4185-93fd-866c791bac9f","resolution":{"observed_at":"2026-08-05T11:27:47.102050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T11:27:47.072265Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.072265Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:9c92c96f2363fac8ccc97e415f3e941a1fb15bacf28ebc8b2f004914ced0ac68","observation_id":"bc7b336e-7c28-4247-84c1-c97ccebf12f9","resolution":{"observed_at":"2026-08-05T11:27:47.072265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T11:27:47.067394Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.067394Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:e83a4e39963beda9ad02cb7ba2343280c2339011b7cc420dc7840b4973ffee70","observation_id":"21ce8e8d-0df4-4b25-bdb4-0b5dcea8cd19","resolution":{"observed_at":"2026-08-05T11:27:47.067394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T11:27:47.062248Z","title":"Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.062248Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:588f383d5e13edd04a1e166d5c659fe35183e0394e00939194bc0c3e9001ffec","observation_id":"0f7d0fa9-84e4-4575-b4cc-093f85176bcc","resolution":{"observed_at":"2026-08-05T11:27:47.062248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T11:27:47.121911Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.121911Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:b26cd89d5c058449d4ea9182be2020405c9f214bd7d6b7a66c530aa8ee096745","observation_id":"6bafd136-ad1a-413c-96a7-1c0255ab1620","resolution":{"observed_at":"2026-08-05T11:27:47.121911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2509.02807."}