{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e68bbf48d7118c04e3a1fbc2ce04817511bc1ef4a9c76376be0a162d5cc4f549","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:50:50.164729Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T09:12:13.460169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:46:27.899181Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.15641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15641","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When and what: Diffusion-grounded videollm with entity aware segmenta- tion for long video understanding.CoRR, abs/2508.15641","venue":null,"work_id":"70c8c4c9-69fd-4116-8b9a-202ed283dd37","year":null},"citing_paper":{"arxiv_id":"2604.27322","last_updated":"2026-04-30T02:08:13Z","snapshot_observed_at":"2026-07-06T23:12:47.745700Z","submitted_at":"2026-04-30T02:08:13Z","title":"YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T09:12:13.460169Z"},"links":{"cited_paper":"/paper/2508.15641","citing_paper":"/paper/2604.27322"},"observation_digest":"sha256:44084127c77017d8abda8a6b5b77b2a02962db2441bffc1d0a129256fb458be4","observation_id":"5238bb53-07cb-4d26-88e8-8d378f7169a6","resolution":{"observed_at":"2026-05-12T09:46:27.901967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15641/citation-record","integrity":"/paper/2508.15641/integrity","json":"/paper/2508.15641/citation-record.json","paper":"/paper/2508.15641"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:51.866926Z","title":"Vtimellm: Empower llm to grasp video moments,","venue":null,"work_id":"41bcfbac-7512-4557-aa8d-9b5ce63e5f51","year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.479947Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:212bfa4b4ec258ee03e93de39d1c4ee8d6c7b1b3fe1461117d7a032a161a4a60","observation_id":"86d4c77b-4a91-45b4-be7f-d6c03b50dd93","resolution":{"observed_at":"2026-08-05T17:50:52.029281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:51.675521Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos,","venue":null,"work_id":"3fb3e63b-084f-45e6-99d2-33bbb457f16f","year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.511981Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:32ea4e15ed313d1913190c05905ee3d29316112f0a4311bb0ea042fd4d799e51","observation_id":"aefeeac5-90d6-4422-91d1-defef698cfa2","resolution":{"observed_at":"2026-08-05T17:50:51.781116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:51.484924Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding,","venue":null,"work_id":"6b370495-be24-4cc2-a950-b5143f490606","year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.594059Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:ca313023f66ef9ed930cc6443aa3849c9714fbe7bee3a6370d8a693ff3dbc361","observation_id":"364333ec-be1b-490d-a1e3-cdf078de5905","resolution":{"observed_at":"2026-08-05T17:50:51.583649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:51.328072Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"1a3a5d97-4930-49c8-aa34-1d5e84cf1e68","year":2022},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.678859Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:e287fb1f05af0b5fc696126015a16af71bc8472f05a3efeec2c34b8a8f75c0b5","observation_id":"f557661a-375b-4218-bfff-7d2641477f6e","resolution":{"observed_at":"2026-08-05T17:50:51.377592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-05T17:50:48.760200Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.760200Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:50f3f11952ce6569e4fa1966d9543f5a0167d1bedc6e8b8243bb697143b5b9ad","observation_id":"0039bdd4-8112-4d21-9d69-1396c1188891","resolution":{"observed_at":"2026-08-05T17:50:48.760200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T17:50:48.860892Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.860892Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:cd992bf9728d9d9a6e11b7273e6e35ea9d936eb5e14ec9dfb9589a3f4ef1e52f","observation_id":"2769dd94-fbfa-4156-8c93-84d1125e4928","resolution":{"observed_at":"2026-08-05T17:50:48.860892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:51.087933Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":"e8db94b0-df14-4ef7-bf84-40cf0fce256b","year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:48.962891Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:2955da2a12de1ca68696eb68b39eedafa3dfb28cd5b2add07dc49f0629daac01","observation_id":"4a68319b-ab34-403f-824d-f917f278a170","resolution":{"observed_at":"2026-08-05T17:50:51.190776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-05T17:50:49.044330Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.044330Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:e1fba107232c05ea5afa222e3f66e7b8d9a7ab3c58232f026ec70a4e4abf76c2","observation_id":"a9a7e9ff-10cd-4e27-b89f-d12e6896098a","resolution":{"observed_at":"2026-08-05T17:50:49.044330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-05T17:50:49.173346Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.173346Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:1f3865c0cab88a506b3ec10c665a2528feb167bc6f2c0bf668b1bcf7ab5c70c4","observation_id":"094dc931-5348-485d-9c67-e8218fcb5610","resolution":{"observed_at":"2026-08-05T17:50:49.173346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:50.930846Z","title":"Longvlm: Efficient long video understanding via large language models,","venue":null,"work_id":"cd34ef64-7d04-42d4-a470-f1da94cd1c6d","year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.247131Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:960a994f56d74d07859c3a471a6e0e70bed2348c23f2265d790e6701a242a0f1","observation_id":"be38c7f1-2134-4f61-a717-636175509c2f","resolution":{"observed_at":"2026-08-05T17:50:51.011850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:50.791784Z","title":"Video summarization using denoising diffusion probabilistic model,","venue":null,"work_id":"60f736a3-c07e-4d8e-9e09-a972a4a02456","year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.390336Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:c785f7fd253d61dadd786bb85a2864dc7ee62406eaa84ebf386fbbc3387abca3","observation_id":"627e59f1-c3ca-40f8-aa2d-712cb0a35502","resolution":{"observed_at":"2026-08-05T17:50:50.847614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-05T17:50:49.465440Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.465440Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:07b6eafa89df482dced24d9d73c4d09e32e7e951ea92d804bf95a1a929d16fe9","observation_id":"9577ab86-3d90-4017-a53a-bb418e43127c","resolution":{"observed_at":"2026-08-05T17:50:49.465440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:50.547946Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos,","venue":null,"work_id":"cd484467-6d3f-4d88-9caa-624449eaba4f","year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.612907Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:cadbd62e01200f961dc7ae0dd7dec771c959163b6f1a3fdf40a6540127967f2d","observation_id":"f9154289-0194-427f-acab-353318a02020","resolution":{"observed_at":"2026-08-05T17:50:50.709653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-05T17:50:49.717507Z","title":"Vace: All-in- one video creation and editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.717507Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:fdee7ee7c6af79dc24d4a6af4f72cf8610bbf8ce4cad58209b7408bd5cf29a1c","observation_id":"e4090a78-d4c2-491d-ae9d-d464582bf38d","resolution":{"observed_at":"2026-08-05T17:50:49.717507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T17:50:49.870293Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.870293Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:4d44b0aeb68d468c94e8af9d52958853cd7e440220e831f330393b321cb550e8","observation_id":"8ffbb9f7-fe06-45a1-8331-7f38b3832e13","resolution":{"observed_at":"2026-08-05T17:50:49.870293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:50.356575Z","title":"Can i trust your answer? visually grounded video question answering,","venue":null,"work_id":"6dcc7036-515d-4260-8f33-d83173edde08","year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:50.011389Z"},"links":{"citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:271817284fff19a4e4849b520aaa738c0cf73548461b9a42e67a36eec60dd29f","observation_id":"ffe4b62a-7b5d-47bb-9c87-db8bf28ba84e","resolution":{"observed_at":"2026-08-05T17:50:50.460962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-05T17:50:50.085949Z","title":"Phi- 4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:50.085949Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:86447f620f9f4778ec679cdcfed022270c5497998c5f5c2570cef43cd50e9b57","observation_id":"c5f7169c-70dc-4323-abb9-7951d3639879","resolution":{"observed_at":"2026-08-05T17:50:50.085949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-05T17:50:50.164729Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:50.164729Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:34ea35e0e93bcd1d42acd8c6b10f5ec3d64b02843b878a78c202d973d9152b2e","observation_id":"26c83433-9103-4c3f-a97f-767d35310425","resolution":{"observed_at":"2026-08-05T17:50:50.164729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T17:50:47.116863Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2508.15641."}