{"as_of":"2026-08-06T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:393b099df34f087ceb05752f4cece321f3661a4b531b2fcd7525b4abb59578e4","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:41:31.700367Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.25886/citation-record","integrity":"/paper/2604.25886/integrity","json":"/paper/2604.25886/citation-record.json","paper":"/paper/2604.25886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.929519Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"c81e85ca-a003-490c-b880-5b39f3cff58b","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a6824aaaa8ed03be4dad6e8516701c55df18bb9044ae33c4a86b7f3dff053190","observation_id":"140600bd-b3cc-4483-88b0-50acf0d6d1a7","resolution":{"observed_at":"2026-07-06T12:52:29.930723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.927771Z","title":"Context-aware biaffine localizing network for temporal sentence grounding","venue":null,"work_id":"08780414-6bcb-45d3-ab6e-668e6ec19601","year":2021},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:4f5c8bb6269b49916471a7af82ce56bd2b5d4649afba57dfbee8bb91736f0e6e","observation_id":"641867e7-b10f-4d3c-85b0-b29f92d5e7ed","resolution":{"observed_at":"2026-07-06T12:52:29.928956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.888484Z","title":"Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"a903b9fb-83ad-4631-b6a6-58fef3e80b58","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:ed557d6cc0e0d0e1707be0d691e4cba2154815124d95a0e03a59e365189ae8fb","observation_id":"dcf9ca09-3fc6-4e26-8af9-3d6855a4d2f3","resolution":{"observed_at":"2026-07-06T12:52:29.889678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.890415Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"f43bf425-a90d-4d68-88de-dc4f7c090c2c","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:12897873ee0213391fa490941048a1ad6fd5313e3e097457b069c76367175fa9","observation_id":"c3f5d603-35ae-48d7-a3ee-45be3ec592d0","resolution":{"observed_at":"2026-07-06T12:52:29.891842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.895976Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":"ce694535-2f50-495b-8230-9c87fbb3d67c","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:73f9176797fd46740ce0185b4f7f8db55d4ea4067b031d6543a40e4b6adc549e","observation_id":"c33fb6a7-93b8-410b-ab79-b58bbd373e39","resolution":{"observed_at":"2026-07-06T12:52:29.897136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19702","last_updated":"2025-02-12T16:47:30Z","snapshot_observed_at":"2026-08-03T13:09:34.548121Z","submitted_at":"2024-10-25T17:19:55Z","title":"TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning","version":2},"cited_work":{"arxiv_id":"2410.19702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.19702","snapshot_observed_at":"2026-07-02T12:16:57.715387Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":"f2ca8961-3931-4220-a78a-7f084312f7b0","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2410.19702","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:44522cce134cce048531cc2bd7a034281fb91b9ca885fbf391d628ad52db4844","observation_id":"f81d4d1d-90c9-4b7f-b36d-96c878701b03","resolution":{"observed_at":"2026-07-01T08:45:34.796582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.899489Z","title":"On the consistency of video large language models in temporal comprehension","venue":null,"work_id":"602b34a2-c900-402e-a345-9d4b93acb08f","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:70c1c040b53029fe0dfaf398676e96a6d837dc033455c0b8131969b624dcb429","observation_id":"c36caa39-d471-4c62-b1ff-4fbdbf1e6be9","resolution":{"observed_at":"2026-07-06T12:52:29.900672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.906299Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection","venue":null,"work_id":"b1891ac4-7696-4472-abb7-dc46b627d0bf","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:3d8a041a2bc4f1644d6c7b00f125fdb9d402a813979e8875a8114d3dad9047e8","observation_id":"21bb46de-5cb1-4227-bbed-d1a16fe0d7e2","resolution":{"observed_at":"2026-07-06T12:52:29.907559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.920442Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"e8c99fea-d59e-4dd6-89fe-761a89049c3a","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:da0455f63c7f51e600dccf4727479b698156df5d3b441587a2a3ff2464c6acad","observation_id":"a90dd20a-34cf-41a0-a0e1-d0642cc72b6e","resolution":{"observed_at":"2026-07-06T12:52:29.921714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:1a1a1557bc2f2ed240fa1c3617d45f94a5e1d22649c0411747456d9f4c670443","observation_id":"c2e25f4e-d662-4fb6-9e07-2e55f82db39b","resolution":{"observed_at":"2026-07-01T08:45:34.799308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.913342Z","title":"Zero-shot video moment retrieval via off-the-shelf multimodal large language models","venue":null,"work_id":"ee3f7823-2119-4684-994e-c5adeb338774","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:f4ba9d977c7d90d947f286c0caaaa541610606f26b7ca3bc8cfa2f7fe42685fc","observation_id":"d61d4b4f-e110-4244-8274-137c203bae06","resolution":{"observed_at":"2026-07-06T12:52:29.914505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.915182Z","title":"Background-aware moment detection for video moment retrieval","venue":null,"work_id":"e5b4b3e3-0501-4304-bcc9-6e7d76de12a0","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:b5a0a3b99ced5e5dab2161c4d517cfd3cfcdd59eae34d124260c36071be965f2","observation_id":"8032a6fe-45fa-4386-82b3-ab100cc10788","resolution":{"observed_at":"2026-07-06T12:52:29.916373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.918542Z","title":"Dense video captioning: A survey of techniques, datasets and evaluation protocols","venue":null,"work_id":"4ea4bba7-e138-4e5a-88ac-b6a73e2c0d70","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:75c234aad12b8f69ff287f06d04e41089aabae25bb3c00469ff6322e68cd2685","observation_id":"965e3597-bd40-45ac-a1c0-7bcbec4c4cac","resolution":{"observed_at":"2026-07-06T12:52:29.919893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.916900Z","title":"Dense video captioning using unsupervised semantic information","venue":null,"work_id":"1b6fef23-6370-458c-8345-0c8e511af0ed","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:410559ecfb1c9b6f4be27558e107ee79baaaacca3b1903ab9218dd240dfc4c05","observation_id":"f8718ead-6a14-44fa-9856-a073aa767d69","resolution":{"observed_at":"2026-07-06T12:52:29.918001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.924040Z","title":"Lvd-2m: A long-take video dataset with temporally dense captions","venue":null,"work_id":"a2034cd8-588a-4332-b3d6-82efd7c47086","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:b8c121a4dd32c4894265420830245d7f2b17a92ae0fc37324900bd97bab7450b","observation_id":"a26210ed-34d9-437f-a76d-b29c279b15a3","resolution":{"observed_at":"2026-07-06T12:52:29.925196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.908098Z","title":"Unsupervised video highlight detection by learning from audio and visual recurrence","venue":null,"work_id":"f80bbdc5-a3c1-4f4d-89c4-756d911b8b95","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a8a77da1487f5b85a070c2e716981e552aa695916a4c608e43fc7ff16fea0c53","observation_id":"eba31263-66a4-4c5a-83fa-12ba049f3164","resolution":{"observed_at":"2026-07-06T12:52:29.909388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.892397Z","title":"Less is more: Learning highlight detection from video duration","venue":null,"work_id":"dfe7f311-c214-4599-a318-3e846bdd6a7a","year":2019},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:95bb45e68296f2024dbc4a0d9fb270095cc6293326b88b56ae5e223843f193ee","observation_id":"f1752f48-a684-4897-a918-b42a02f1af8d","resolution":{"observed_at":"2026-07-06T12:52:29.893588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.911565Z","title":"Contrastive learn- ing for unsupervised video highlight detection","venue":null,"work_id":"1d4ad401-e194-4acf-9858-424b07d104be","year":2022},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:d172e107b4564a1944f5eb53eff8ea5b2fefb816b040922a74e64f5c45828362","observation_id":"f69f8d2e-543c-4534-9bb4-8d5d1e5d34fa","resolution":{"observed_at":"2026-07-06T12:52:29.912767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.849466Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"dc1e7a3f-ac79-4b3e-b363-0813f609962b","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:7e4531c50bc1f9ad7f308c3895ceec35739ae3daf63047360e6493aed211ebf9","observation_id":"6815b9c0-d40d-49b5-9b76-deabc2207972","resolution":{"observed_at":"2026-07-06T12:52:29.850890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.858977Z","title":"Tvqa+: Spatio-temporal grounding for video question answering","venue":null,"work_id":"a5bc305f-453a-43ea-b16b-9b5f8cf3d9e4","year":2020},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:f2fa1f17e05ae32a4bfbaa2569820c0b13cf81ef7340356b2b49b13b00b6ddf7","observation_id":"97f42890-b4db-45fd-936a-b333dc3cdd4d","resolution":{"observed_at":"2026-07-06T12:52:29.860159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.877340Z","title":"Timecraft: Navigate weakly-supervised temporal grounded video question answering via bi-directional reasoning","venue":null,"work_id":"f780bae7-57ad-4c51-bb99-9c65a0cdae4f","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:7677fb85aedcff919c51598fb5bd195b8e3b9cbc469f944f78cab5b33af48ac6","observation_id":"7610431d-2804-432a-ba4d-cfd0c90a941d","resolution":{"observed_at":"2026-07-06T12:52:29.878740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.881141Z","title":"Grounded question-answering in long egocentric videos","venue":null,"work_id":"d59f1ea9-6088-4850-897e-4f7854bc700e","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:286c1d7f3823da33462aed7312a9065dd59a573ad6c0f5d11f77f8fa2e86fbfd","observation_id":"063e4e36-3f3d-4609-889c-187dfc7381af","resolution":{"observed_at":"2026-07-06T12:52:29.882280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.851453Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"e4abf60a-1a69-4572-83c0-5503fa549094","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:9cb30412bd96521330ac4949b99352384b24d430f4b4e13ae4bafc517709b7e6","observation_id":"7dc83e2b-e036-4bdf-99a3-5ca86ee44eb5","resolution":{"observed_at":"2026-07-06T12:52:29.852676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.853232Z","title":"A survey on video temporal grounding with multimodal large lan- guage model","venue":null,"work_id":"30b46f6d-bddc-4a84-9e96-bd232263ed43","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:2ae7e94ff03bb1a7ec7c4675cf7a98a48189399323f002430b5d72b983894e13","observation_id":"5be6577f-0360-4df6-bcda-85ac9fc5504d","resolution":{"observed_at":"2026-07-06T12:52:29.854562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-05T22:01:25.072556Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":"2508.07683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07683","snapshot_observed_at":"2026-07-02T17:27:14.974912Z","title":"Tar-tvg: Enhancing vlms with timestamp anchor-constrained reasoning for temporal video grounding","venue":"cs.CV","work_id":"8392709e-ece1-4e93-a81c-3f6b3b4a5fc6","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2508.07683","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:9d3e4d930c5d8e0697bbdb8d4dedefb2fcc2e62197f0e0f33302da2aae5cee58","observation_id":"d1ffa588-fc59-40b6-9d71-a39139421e77","resolution":{"observed_at":"2026-07-01T08:45:34.785938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.13353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.805796Z","title":"Alvarez, Lei Zhang, and Zhiding Yu","venue":null,"work_id":"48846511-6257-4407-84b6-9a66b100455c","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a29503c48906b206c92ec9d45cd6bbc792584de77cb60989d272210052cbd634","observation_id":"d6a29860-7a1a-422e-9de5-4fb838b158e3","resolution":{"observed_at":"2026-07-01T08:45:34.751361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.873856Z","title":"Towards visual-prompt temporal answer grounding in instructional video","venue":null,"work_id":"50246a12-5217-4043-a4ce-056c5e8d47b3","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:28c24070e4742177731afeb63bd422a75842af8dc9301c7685a63ded30af033e","observation_id":"90111710-33c5-404b-9afb-80e8eb15db3c","resolution":{"observed_at":"2026-07-06T12:52:29.874971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.879307Z","title":"Number it: Temporal grounding videos like flipping manga","venue":null,"work_id":"070fb1dc-d3ae-48b7-85e6-d48ad59a334a","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:283fc2cbd7802fc69ff91fd82f8cf0d067fa9bb701156baf1d8184b355e4f234","observation_id":"4ffc359c-2fbf-4611-a7e5-00a4a5286d97","resolution":{"observed_at":"2026-07-06T12:52:29.880594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.886773Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"71242262-ba16-4a98-b7be-21c12ec748a5","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:d6c65a0458154cf0056d15eb565650f12c653c9c346b79c05d938d13b0aa252e","observation_id":"03fad860-5072-48ff-bc0f-6a89113d0702","resolution":{"observed_at":"2026-07-06T12:52:29.887923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.897667Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"2f35e428-2508-4788-b0e1-05b656b7ee08","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:ecb0705437ef78d9aa38d9ed647bf4fd88b0bed51831ec9687fea1d3153404aa","observation_id":"54bd5be4-ee64-4b75-afce-bad464169b8b","resolution":{"observed_at":"2026-07-06T12:52:29.898954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.902885Z","title":"Training-free video temporal grounding using large-scale pre-trained models","venue":null,"work_id":"04f0ea82-a448-4aaf-b0a7-5ebe254e6102","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:3dcb2e1c29f8fecb7922407ba8ee6656b1c4ea32b7df4cc2f535dd2d4bef8d47","observation_id":"37509041-2377-4856-9312-547eb491ec15","resolution":{"observed_at":"2026-07-06T12:52:29.904056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-01T19:33:10.793870Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":"2410.05643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-07-02T12:16:57.678370Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"b2af5095-2950-48b5-af5e-270218b8d041","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:6daf5c78b0a8dc7177592ce1b0a26ec9e0a160a60af029c1b65328eddb3b85aa","observation_id":"055d4cd6-6130-414a-b394-1959201a0180","resolution":{"observed_at":"2026-07-01T08:45:34.789428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.925741Z","title":"Omni-rgpt: Unifying image and video region-level understanding via token marks","venue":null,"work_id":"fe79ea44-f274-4ec7-8c0c-ce095e2270b4","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:591e3b17d37c077fa3c9854242a9abbc41be4ca9da29ca40ff19159ace5d5457","observation_id":"439a5904-bd81-4259-9ab6-974e0356269a","resolution":{"observed_at":"2026-07-06T12:52:29.927175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":"2501.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-10T03:06:43.598138Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":"cs.CV","work_id":"fbffda10-106c-432c-b84e-5d0908666921","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:59c77979b76a824397a9e5011ba0918cd0b177b77db4189902a63349902dc0ae","observation_id":"67edd1eb-495a-4cd3-8238-ec895844a8ee","resolution":{"observed_at":"2026-07-01T08:45:34.779591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T08:45:34.747270Z","title":"Sa2va- i: Improving sa2va results with consistent training and inference","venue":null,"work_id":"60d9d17e-c310-4b43-a743-5e0655beb3a9","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:9bbc2142293648fe8c64f25ac2117e0c8ac9b0fef67858937546170874b27427","observation_id":"26f41eed-5359-4dcb-a9f4-e9fd5ac1600b","resolution":{"observed_at":"2026-07-01T08:45:34.749187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.860896Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos","venue":null,"work_id":"70b9d633-bdaa-4eec-821a-7faf6ec6f313","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:5743995679f069dc023eaa0b0ea83ce0920323c4c5608648b45d1a57369526e5","observation_id":"1e33ad75-ace6-4194-9d3c-7c060947b04c","resolution":{"observed_at":"2026-07-06T12:52:29.862249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.870548Z","title":"Videorefer suite: Advancing spatial- temporal object understanding with video llm","venue":null,"work_id":"c9fe02a2-f02e-42e6-a0e9-e725094539d2","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:ec4ee58213a56f83d64fb832c22417bed93b207c1ad0f656d0999cf2d66ac161","observation_id":"7bbc80e7-0eeb-43aa-aea5-a9a56bb47d97","resolution":{"observed_at":"2026-07-06T12:52:29.871711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.864576Z","title":"Vip-llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"5acf5441-5d23-46db-9c2a-0a8e15d9cb47","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:bd2f3fdd076e71c1c13f2173a1430695e1a780d3adf3bbc5efe05a15c2aa7ba7","observation_id":"0d8e9173-957b-45ba-a782-b4599bbda1dc","resolution":{"observed_at":"2026-07-06T12:52:29.866093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.866680Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":"1b62e8b3-60dc-4cdc-900c-fca683b7df67","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:c790f11e65f7b65f5bfc6cacf58d108de8fee64ae92532d95368d8a788bdba67","observation_id":"4c7421cf-7e64-4f08-9a93-2e0f1954ba18","resolution":{"observed_at":"2026-07-06T12:52:29.867884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.904578Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"2b2cac65-6824-4ebc-824b-d70a506f055d","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:48110a0a928391770540c2ca531d592f9e2cc5786e383e01dd38d825e3b81b24","observation_id":"53a9a5f1-e08c-4ec3-a4d5-e6e3ce76512e","resolution":{"observed_at":"2026-07-06T12:52:29.905750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.909931Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"04573e48-4b07-4285-9413-c73ce8c9c3b8","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:e5d73dcfb2fc339cdc0f376aa5d9a1fa3802c098e12eda3a0dff91a2df1063a5","observation_id":"23edf9ce-eec1-4996-b474-7cdcb2dfd904","resolution":{"observed_at":"2026-07-06T12:52:29.911046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.872216Z","title":"Lisa: Rea- soning segmentation via large language model","venue":null,"work_id":"ac53cf1e-9cce-4e80-a493-f99612f1cd3a","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:b9f73d2e0319d0996945da68c4277e505c4262b9800bbd1b9e53154beaa34711","observation_id":"63c51d81-258c-414b-812d-20b1ea2b92f4","resolution":{"observed_at":"2026-07-06T12:52:29.873349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-07-06T17:31:33.340510Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":"2402.11248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-07-01T08:45:34.774087Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":"b0aeb450-d3d8-464b-a89e-e3b97712885b","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:b1f85edc3e3b49796b2f6910f7520e798284a60611d7d2ee3c091b9ad3afe4ed","observation_id":"575d8c05-c7f7-42c1-a20a-3df06e7a08c6","resolution":{"observed_at":"2026-07-01T08:45:34.776035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.964521Z","title":"Segment anything","venue":null,"work_id":"13c25dad-afdb-4387-941e-ada5036e01fc","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:1e5aae6b00880cd89a7a52629552b7d61813b195d04c7c0cdd4f4dbde1e3c619","observation_id":"f9e505eb-d405-4ced-8f5e-c157b04b840b","resolution":{"observed_at":"2026-07-06T12:52:29.876630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:1e2d0c168348d0448601a6bddf3c907e3f40410cee526ddaab94396ed40bf510","observation_id":"1dfbf54c-991e-4217-83b0-d42f4c33c253","resolution":{"observed_at":"2026-07-01T08:45:34.779470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.883004Z","title":"GroundingGPT: Language enhanced multi-modal grounding model","venue":null,"work_id":"9bbfb8fa-2897-427b-8428-e55cda48794f","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:aaa28c7cf797aa445844aed39b13bc58a53dbc13eb4a72875410111e9e3ff26b","observation_id":"8ae83314-bd9e-4409-bae3-9e23baddcca8","resolution":{"observed_at":"2026-07-06T12:52:29.884170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-07-06T17:52:18.041492Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":"2403.19046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-07-01T08:45:34.780803Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"c5e1b006-a6ee-46f8-aa80-54a0ede9866f","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a8240af1ed36e40894e19ef9f25dc68bd457af1fb54de1aa541f59a507830581","observation_id":"5b05204d-7ba7-46d1-8390-b6a87e3d9a5e","resolution":{"observed_at":"2026-07-01T08:45:34.782507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-07-06T18:17:46.369537Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":"2405.13382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-07-01T08:45:34.783942Z","title":"Vtg-llm: Integrating timestamp knowl- edge into video llms for enhanced video temporal grounding","venue":null,"work_id":"ce44e7a4-75c6-4b05-a452-fbdb2f3bced2","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:fc9d4003d28120dd319076ece96b951ee8334d18e00179276411fcf8d242d9cf","observation_id":"4ce1d25a-5e4d-49f4-b27a-7c775f745683","resolution":{"observed_at":"2026-07-01T08:45:34.786182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.884729Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"8b4c553b-1b0e-42a7-aec6-0a296bcea8f7","year":null},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:cbd5e3e9985c163e3bcb4dba3597a73f6dbeb57a702b1f1d74f72f451f3c707f","observation_id":"53319488-39a1-4251-bfa8-9a8cf9e6612a","resolution":{"observed_at":"2026-07-06T12:52:29.885931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-07-06T16:56:42.232555Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:f133ef7704cbbf8b92b818635ffa18ba60bc830cfd039b1ad9299d73355d420c","observation_id":"7ba36f90-8d5b-4224-860b-09a8bac66510","resolution":{"observed_at":"2026-07-01T08:45:34.755963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:3ed02ef5e1dad67b767773b99a8d93c435053aa2c003e28fdefb5f2494b50450","observation_id":"b8b842b8-d96b-4015-8c38-0b713131a6bb","resolution":{"observed_at":"2026-07-01T08:45:34.768754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:c0c64250919f2b1780561b88fec56737af8ebda42315595b8440475a42a3e583","observation_id":"39369fc2-1877-4b2d-8361-27fbb69b7a60","resolution":{"observed_at":"2026-07-01T08:45:34.782509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.894129Z","title":"Hawkeye: Training video-text llms for grounding text in videos","venue":null,"work_id":"bc8413e3-f7b0-4622-ad49-5f2e9f82c153","year":null},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:dae89116f750134ee1f7f4d5eb3247db76bd0ea9e2595835cf4ac514fd97c65a","observation_id":"34063787-d5e0-4c4b-a715-e96d5de010e5","resolution":{"observed_at":"2026-07-06T12:52:29.895432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":"2403.10228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-07-03T20:38:56.195732Z","title":"arXiv preprint arXiv:2403.10228 , year=","venue":null,"work_id":"fb2ec1aa-a3b0-43e2-9e93-2b73d3097074","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:df92ae639d81d7dd4bdfedcd7d23960e2296a25355ac52141841d429d5489114","observation_id":"d46e3d6c-f44f-496b-9a3d-863043f454d6","resolution":{"observed_at":"2026-07-01T08:45:34.762438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a1f706a6d2d7b674de4e523c53a7c2a4cb793e7d833d2e82ec7cbdeb6cc54a51","observation_id":"b7feabb6-0a7b-4090-9f69-22bb55cfd53c","resolution":{"observed_at":"2026-07-01T08:45:34.768697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.901195Z","title":"Tall: Temporal activity local- ization via language query","venue":null,"work_id":"61b8ca7f-43d3-4a23-8e50-231ead206b03","year":2017},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:24965197a7734d2cba24c2917d0ef2d8137960940619c0333a0c960c8a81e624","observation_id":"94957e16-60aa-46c2-8b6f-105f9b7a6672","resolution":{"observed_at":"2026-07-06T12:52:29.902357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.922246Z","title":"Activitynet: A large-scale video benchmark for human activity under- standing","venue":null,"work_id":"30e1252a-0550-4dc8-acee-d7be80f16891","year":2015},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:6cf7ec61d818d44cebf18a37fc55c6b3d8a11a7f644280474bc2cb895580a0e7","observation_id":"2453830b-a0cd-45fa-af24-12106c294f30","resolution":{"observed_at":"2026-07-06T12:52:29.923364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.855123Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":"20c92f9e-707d-4c4b-be54-9984e69f39b6","year":2021},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a9fee3ffd47e7fcba999fcc985075ece88a520a94c5a5957689ebc841afe749b","observation_id":"07afdd43-58a4-41f8-bc00-833bafa767f4","resolution":{"observed_at":"2026-07-06T12:52:29.856383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:adec495cbff9130dfeb4b568581994716e3b99ba091a32071d68b8494df609a9","observation_id":"441a83b3-bcfa-43fe-9b7c-3c71bebbe125","resolution":{"observed_at":"2026-07-01T08:45:34.772580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:39:59.453061Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":"a0e33ede-c407-42a2-ba32-cf37d849c193","year":2025},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:b565a3b7bf0d500ba76c3a74a6821fd42a316200a6f1aadf42e04c31f200161b","observation_id":"a101b8b2-1b9b-4349-a689-88ed2a3ae3b1","resolution":{"observed_at":"2026-07-01T08:45:34.789794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.857104Z","title":"Two men both dressed in athletic gear are standing and talking in an indoor weight lifting gym filled with other equipment","venue":null,"work_id":"d154fead-1946-49fe-ab0c-19efb23d9c49","year":null},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:558d8868fb613149ea32dd0a22fe0a65b819d01f47857d17ba413c9a3073de79","observation_id":"256f25d8-18cb-442b-8ccc-d94f234e76c4","resolution":{"observed_at":"2026-07-06T12:52:29.858395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.862827Z","title":"Overall trends are consistent with those observed on ActivityNet","venue":null,"work_id":"a696c513-ea65-402f-a696-66f179cd12f7","year":null},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:c5639733692a4d20150c2182d8758b4e7089b68d44b24fa5465f06fa4d0be29d","observation_id":"169c417a-584e-4927-91a6-1a0b8ec978e7","resolution":{"observed_at":"2026-07-06T12:52:29.864028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.868656Z","title":"Table 6 reports the effect of different color parameteriza- tions on ActivityNet","venue":null,"work_id":"b7147338-dbd7-445a-9207-3f7be6309e03","year":null},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:774da1eaf6206af8ef58a096de6c3ad50ebe4ab9867cea0d8346912b9454455c","observation_id":"226ef46f-8d68-447e-b4b3-2ec24e30e022","resolution":{"observed_at":"2026-07-06T12:52:29.869944Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","latest_version":3,"primary_category":"cs.MM","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":44},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2604.25886."}