{"as_of":"2026-08-11T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d788312e5913171a80beba5b5ec874f68037314a851bd7685bbe4431ae1ccff","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:04:18.778402Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17423/citation-record","integrity":"/paper/2607.17423/integrity","json":"/paper/2607.17423/citation-record.json","paper":"/paper/2607.17423"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25979","snapshot_observed_at":"2026-08-01T18:04:11.814953Z","title":"Llava-onevision-2: Towards next-generation perceptual intelligence.arXiv preprint arXiv:2605.25979, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:11.814953Z"},"links":{"cited_paper":"/paper/2605.25979","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:2bdab26b8d906dfb3fa30a2592ab0ac5f7b44add9178b519ef67642033de1a8d","observation_id":"4fbf2bb5-3bfd-4746-9479-38aa8d899787","resolution":{"observed_at":"2026-08-01T18:04:11.814953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T18:04:11.894973Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:11.894973Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:0845dc5a5bf05d27f63c5d1160043ee4aa4254272f6f1eee7a1f9b7372a4a5bf","observation_id":"e47f7bf5-2291-4a4f-ad49-f82cb3617343","resolution":{"observed_at":"2026-08-01T18:04:11.894973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:11.957891Z","title":"Datasets and recipes for video temporal grounding via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:11.957891Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:278a071de5bca43c37645cfb67b59781f187e877d0cd9b19e92349466fcdad64","observation_id":"a43b0ddf-e971-4caa-b524-290c6692693c","resolution":{"observed_at":"2026-08-01T18:04:11.957891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.026393Z","title":"Molmo2: Open weights and data for vision-language models with video understanding and grounding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.026393Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:88a7b3b862eff40c137548884dd88e058074d669249128b023c792aeb1b1b0df","observation_id":"9d1a2cd6-e9c6-4f93-a0d8-a88ce0caa454","resolution":{"observed_at":"2026-08-01T18:04:12.026393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.116730Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507 .06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.116730Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:ccabdf4b84f4f81d33c67d6f0d3b93a9c4115d5121d6c2b196560109b674dfa2","observation_id":"059a5502-af0b-4fde-9539-e30507a0718a","resolution":{"observed_at":"2026-08-01T18:04:12.116730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.181473Z","title":"Videotg-r1: Boosting video temporal grounding via curriculum reinforcement learning on reflected boundary annotations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.181473Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fbfd329354266608b6fce03b1d89ae72540871c0e10ad26c016ac4a8015dd4f0","observation_id":"73e57905-d4a7-41ea-80be-b4f245be7ed3","resolution":{"observed_at":"2026-08-01T18:04:12.181473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.271974Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.271974Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:b253593741c1b3192a3c95b5347814bca9df4e3fe6c65146aac6fd6a340b47f9","observation_id":"0ec66415-43cf-4903-bb10-85bd008682e5","resolution":{"observed_at":"2026-08-01T18:04:12.271974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.314399Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.314399Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:5bad394df6c25a1dc9a7db5168b897efc2783247f3714100b578aaa7881da3dc","observation_id":"aca75ebe-4d89-4aec-a7a2-c0deb2987cfc","resolution":{"observed_at":"2026-08-01T18:04:12.314399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.417300Z","title":"Gemini 3: News and announcements","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.417300Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:242bc56d5c2cec5834a88034e838ca5c1f49134be0cc1a21785c1119e10e2966","observation_id":"00a3de38-b3b8-44c6-9dd0-97df952286d8","resolution":{"observed_at":"2026-08-01T18:04:12.417300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.520446Z","title":"Gemini 3.1 Pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.520446Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:b81cb17d8f9adc8f8f526a2bc5943151cb456fe9cc030bbc07ac97ccf03ab92f","observation_id":"92430fee-c7b6-472d-b36b-30f9699cc9d4","resolution":{"observed_at":"2026-08-01T18:04:12.520446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.622844Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.622844Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fa42b756f044466215097b1b8183f3123fa4df333df4bdbfe0833b932bc7a113","observation_id":"9eab2dcb-7639-4823-ab5c-4f1d9fee1ddc","resolution":{"observed_at":"2026-08-01T18:04:12.622844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.01641","last_updated":"2017-08-04T18:57:52Z","snapshot_observed_at":"2026-08-07T11:53:24.167018Z","submitted_at":"2017-08-04T18:57:52Z","title":"Localizing Moments in Video with Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.01641","snapshot_observed_at":"2026-08-01T18:04:12.732459Z","title":"Localizing moments in video with natural language, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.732459Z"},"links":{"cited_paper":"/paper/1708.01641","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:a784c068fdaeba295c713c0e9b04c0c8a9e1b0eabcfc7c5befa18c796a9fec2f","observation_id":"139f3aab-6821-4eeb-b534-d7e821f6df95","resolution":{"observed_at":"2026-08-01T18:04:12.732459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:12.882777Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:12.882777Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:cf2e6fa9947b85edc2da642b949309275e00567b47d19283f809551f24877120","observation_id":"099d850f-03b4-4c49-a708-09c642f738b6","resolution":{"observed_at":"2026-08-01T18:04:12.882777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-07-06T17:52:18.041492Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-01T18:04:13.016062Z","title":"Lita: Language instructed temporal-localization assistant, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.016062Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:a9dff9599f06c71818c584fde9cc0791345c46724fdb0e61f7007a51f30053fc","observation_id":"8c5403d0-92cf-47d4-993f-5a92696f85b8","resolution":{"observed_at":"2026-08-01T18:04:13.016062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:13.152921Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.152921Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:c15f7a7c85ac8c7640399f9c1f67e64f1a0147ca1a41f2c273e57b77c2efef86","observation_id":"179ba791-00e1-48fa-8e0e-2859a7c0df08","resolution":{"observed_at":"2026-08-01T18:04:13.152921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09099","last_updated":"2020-08-18T15:12:14Z","snapshot_observed_at":"2026-08-11T01:27:16.812563Z","submitted_at":"2020-01-24T17:09:39Z","title":"TVR: A Large-Scale Dataset for Video-Subtitle Moment Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09099","snapshot_observed_at":"2026-08-01T18:04:13.257343Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.257343Z"},"links":{"cited_paper":"/paper/2001.09099","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:b221ea86e56cfef08f26c37f065442c794b1fc6821e517ec23097b354db7a14e","observation_id":"223b8135-a465-4576-a9fa-84c7378c026d","resolution":{"observed_at":"2026-08-01T18:04:13.257343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:13.355952Z","title":"Detecting moments and highlights in videos via natural language queries.Advances in Neural Information Processing Systems, 34:11846–11858, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.355952Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:c30418b80ec9f9d7b776bdb52d88a4c2ecb17a0dbb8afd3964854b74e9bc3bc2","observation_id":"d2ed9961-3dde-4e99-8705-7f2a2c9d4cfd","resolution":{"observed_at":"2026-08-01T18:04:13.355952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-08-01T18:04:13.530716Z","title":"Re- inforcement learning tuning for videollms: Reward design and data efficiency.arXiv preprint arXiv:2506.01908, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.530716Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:15f09b81b04839ce4ae2bb76823195cb80a77fdb6d81cf617265dee9737c2fc8","observation_id":"2c46cb5e-b4d1-46c7-a68f-ac8bc4892e0c","resolution":{"observed_at":"2026-08-01T18:04:13.530716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-11T10:27:58.772493Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02994","snapshot_observed_at":"2026-08-01T18:04:13.665607Z","title":"Video-opd: Efficient post-training of multimodal large language models for temporal video grounding via on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.665607Z"},"links":{"cited_paper":"/paper/2602.02994","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:6e2f22bd12ae02ca8e287cbee2b725860ba3e2b26f31e3fd6a8d1bf228e93513","observation_id":"10e5ab85-771f-4d47-ae18-fd8c099da7a4","resolution":{"observed_at":"2026-08-01T18:04:13.665607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:13.757299Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.757299Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:af830aaeea4daa3ded7b5ff0a598f4224a028f0ac58c9413815c35c04a9fe24d","observation_id":"d5e42eb8-c67e-4065-8607-1efa4d8c3892","resolution":{"observed_at":"2026-08-01T18:04:13.757299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-01T18:04:14.015999Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling.arXiv preprint arXiv:2501.00574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.015999Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:1d90ee4d6a1e8a1a962f1f29a58752e73e9a5f4835cf369039ec8ebfb6f4f52d","observation_id":"b7669212-e82e-4bbf-b512-faae1e162957","resolution":{"observed_at":"2026-08-01T18:04:14.015999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-01T18:04:14.127600Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.127600Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:263954dd0a99687ea197b2721b5a02cc8547464f107a0642fc56d6bd6ca3d035","observation_id":"bf5e9282-a80f-4f2f-a576-9c0d5aed7c4b","resolution":{"observed_at":"2026-08-01T18:04:14.127600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:14.235040Z","title":"Videochat3: Fully open video mllm for efficient and generalist video understanding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.235040Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:1bcb2c60a46c1fc2a105055c8eac692faf362fa191b741b961dceeb6fddf5f88","observation_id":"78f1ef15-8a81-402f-8f95-67f877d1628e","resolution":{"observed_at":"2026-08-01T18:04:14.235040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:14.328488Z","title":"Reasoning guided embeddings: Leveraging mllm reasoning for improved multimodal retrieval,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.328488Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:c00d74f7e8ee1c3e8dde0d4712e5251772d6e94a2b548345ad4219bbfd092034","observation_id":"8b06fb38-f3d3-4955-92bd-09a38536e1d1","resolution":{"observed_at":"2026-08-01T18:04:14.328488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.1644","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:08:29.911014Z","title":"Museg: Reinforcing video temporal understanding via timestamp-aware multi-segment grounding","venue":null,"work_id":"0091d4b2-1102-44cf-b98d-ec17f4456a91","year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.546806Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:89c67beeff0b08a2f0f08c41849291c864b463ebbf3fb95e4055f1667d2d2c69","observation_id":"14c19113-53b7-4a41-8a1d-c6fd6fa5dabf","resolution":{"observed_at":"2026-08-01T18:08:30.024776Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:14.669524Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.669524Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:d7e943d1664394e06416014eeea9957fb123eac09eca637e64b625cf52d55f99","observation_id":"7f387542-4d9a-48f4-9f19-bcb55b6705d2","resolution":{"observed_at":"2026-08-01T18:04:14.669524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03327","last_updated":"2019-07-31T13:47:49Z","snapshot_observed_at":"2026-08-06T17:13:51.462168Z","submitted_at":"2019-06-07T20:48:19Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03327","snapshot_observed_at":"2026-08-01T18:04:14.772882Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.772882Z"},"links":{"cited_paper":"/paper/1906.03327","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:899ad85c4c234daca9e025e1ddd1a9910bd1991f8f94e28d7f5494a0f5b3ae0e","observation_id":"1e0810f7-9469-4c59-894d-39418a7e82a0","resolution":{"observed_at":"2026-08-01T18:04:14.772882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:14.881238Z","title":"Marlin-2B: A tiny vlm to extract structured information from videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.881238Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:37bc006c368a9d9b38abb0649546d045473fed502a66772ad4dad8c6b1360fb5","observation_id":"29babcf6-c2e5-4b27-a890-9923877ce07f","resolution":{"observed_at":"2026-08-01T18:04:14.881238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:15.004582Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.004582Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:620c39df3fc08229050872af57a9949db8e1a51d67cca52e89cdf11e5207072b","observation_id":"ada93f3e-93ae-4131-abeb-5012eb861180","resolution":{"observed_at":"2026-08-01T18:04:15.004582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:15.294809Z","title":"Grounding action descriptions in videos.Transactions of the Association for Computational Linguistics, 1:25–36, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.294809Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:5ce672a1b2248e825c3dd7869b44e8841b64ecb1572c93309801af9a7ed1490e","observation_id":"41a22f8b-3d8d-46a9-8870-cd9ad523c70b","resolution":{"observed_at":"2026-08-01T18:04:15.294809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-01T18:04:15.439960Z","title":"Timechat: A time-sensitive multi- modal large language model for long video understanding.ArXiv, abs/2312.02051, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.439960Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fc2189af142dc4c274dcadc4dc98c2a251a08c44c4d1f6b1f1cd7c6b7ada1175","observation_id":"b0c52bc0-b812-4f45-9d1b-c2b9ab76835b","resolution":{"observed_at":"2026-08-01T18:04:15.439960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T18:04:15.492873Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.492873Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:4a3f90d10a454c2008e91ecb836dd1b1cda1b3e2956bf14dd3f34d4fde08ad1e","observation_id":"2674f1fc-52b0-4580-82df-00b95c7128ba","resolution":{"observed_at":"2026-08-01T18:04:15.492873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-01T18:04:15.558089Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.558089Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fd92420e7b27f970231df063584c649333505c41a5e787501528a2c783e9c229","observation_id":"7e78a13a-2ef9-42b9-8914-7e31a81b4bb5","resolution":{"observed_at":"2026-08-01T18:04:15.558089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:15.667362Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.667362Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:75dc2ddf83344b423af625915d0683c56f68eed2f167f2e736584ed1c4e58e09","observation_id":"69bf28ef-0359-471e-8b25-70504e703138","resolution":{"observed_at":"2026-08-01T18:04:15.667362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.02874","last_updated":"2019-03-07T12:32:32Z","snapshot_observed_at":"2026-08-08T19:51:23.591885Z","submitted_at":"2019-03-07T12:32:32Z","title":"COIN: A Large-scale Dataset for Comprehensive Instructional Video Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.02874","snapshot_observed_at":"2026-08-01T18:04:15.752349Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.752349Z"},"links":{"cited_paper":"/paper/1903.02874","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:f727878edead92f938b55b71ee894ec141008de4a2611b50267e477f5248e12c","observation_id":"d9222fbf-c7ac-4b7e-a31d-41179b977905","resolution":{"observed_at":"2026-08-01T18:04:15.752349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-01T18:04:15.818965Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.818965Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:2dd7437178fc2e085fb3cd07f366841090126340b12b0b9a35ea6e82ae504555","observation_id":"26c1c30c-696d-4072-a9f6-de58c86f7386","resolution":{"observed_at":"2026-08-01T18:04:15.818965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:15.902409Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.902409Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:4c8bcc2afe2318235a02c27e85e3f09f76482bfbdc0638e24bef911e3a8c1eb5","observation_id":"67dcbd89-cb3d-4cd5-b5e4-caec2b66390e","resolution":{"observed_at":"2026-08-01T18:04:15.902409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15681","last_updated":"2025-07-16T22:41:17Z","snapshot_observed_at":"2026-08-10T08:10:44.637243Z","submitted_at":"2025-04-22T08:04:45Z","title":"Vidi: Large Multimodal Models for Video Understanding and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15681","snapshot_observed_at":"2026-08-01T18:04:15.986807Z","title":"Vidi: Large multimodal models for video understanding and editing.arXiv preprint arXiv:2504.15681, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.986807Z"},"links":{"cited_paper":"/paper/2504.15681","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:429286d2b99da8862ee74314e999d04fc33df0f39ff53ce9eca8246b0b415f6e","observation_id":"48bf1810-df25-4868-a715-14b523634f5d","resolution":{"observed_at":"2026-08-01T18:04:15.986807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:16.079361Z","title":"Vidi2: Large multimodal models for video understanding and creation.arXiv preprint arXiv:2511.19529, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.079361Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:de5d890b49687cb2da81c605eb1b8a25bf61dd3eb99159390503e817ad013ec8","observation_id":"360963f2-5000-4297-9c4a-9b390abc450e","resolution":{"observed_at":"2026-08-01T18:04:16.079361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:16.161206Z","title":"Internvideo-next: Towards general video foundation models without video- text supervision, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.161206Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:7e15390c99a4fb035499ecfb0f9836c3f0ffe48898a6e2eced0a535c39ed15c2","observation_id":"f62f73a4-15c5-4cb1-bffd-ad293bc142cb","resolution":{"observed_at":"2026-08-01T18:04:16.161206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-01T18:04:16.246667Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.246667Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fce03d01e208ec261a5f96cc00049b89e85801e520dd363bc96d6c26d1f66e74","observation_id":"2c1b856a-8498-4fe4-aeb1-ca770c12920d","resolution":{"observed_at":"2026-08-01T18:04:16.246667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13389","last_updated":"2022-06-14T12:58:44Z","snapshot_observed_at":"2026-07-06T12:01:47.870599Z","submitted_at":"2021-10-26T03:43:17Z","title":"A Normalized Gaussian Wasserstein Distance for Tiny Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13389","snapshot_observed_at":"2026-08-01T18:04:16.360822Z","title":"A normalized gaussian wasserstein distance for tiny object detection.arXiv preprint arXiv:2110.13389, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.360822Z"},"links":{"cited_paper":"/paper/2110.13389","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:001686ae61db2f58e978a09cc466862d0a6fc4547553ae1b1e7debe8b5bc60b8","observation_id":"22e2741a-b09a-42a9-bf61-b6707c2e31d2","resolution":{"observed_at":"2026-08-01T18:04:16.360822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T18:04:16.535585Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.535585Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:4b60f510c1d0c9c37538bd3445a0fb796a3d6950e97c593700276abcd7788cea","observation_id":"765c908c-d3a4-47e7-956a-7a492c8ae1e8","resolution":{"observed_at":"2026-08-01T18:04:16.535585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-01T18:04:16.679249Z","title":"Time-r1: Post-training large vision language model for temporal video grounding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.679249Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:c498020fe4949862d3e16368537d2be686539b89ce4f48d04904a93967df6edc","observation_id":"0841f998-78fb-4532-98b2-2e9a50486d46","resolution":{"observed_at":"2026-08-01T18:04:16.679249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-08-11T03:45:42.619022Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03963","snapshot_observed_at":"2026-08-01T18:04:16.823032Z","title":"Tempr1: Improving temporal understanding of mllms via temporal-aware multi-task reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.823032Z"},"links":{"cited_paper":"/paper/2512.03963","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:f64231fc3892ae70c478d9ee5f63210f8de75b74bebc8832e32f94980e321192","observation_id":"31e83b57-04d5-45c2-93b1-b4bffa41c296","resolution":{"observed_at":"2026-08-01T18:04:16.823032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-01T18:04:17.011960Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.011960Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:0b6fa7c2b4689bf352f2253695ec8e1276ac6ac59c53ff31e6e1df1cd66076dc","observation_id":"8c9a65e3-14b0-4b3d-bf4e-54edb7612293","resolution":{"observed_at":"2026-08-01T18:04:17.011960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12195","snapshot_observed_at":"2026-08-01T18:04:17.133693Z","title":"Internvideo3: Agentify foundation models with multimodal contextual reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.133693Z"},"links":{"cited_paper":"/paper/2606.12195","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:0ae5094aff77044ae749c11592266b4a1e08393e30f923394e8eab477b60df4b","observation_id":"02c8c4c3-0f6e-4e29-b8cc-cc9cf28e9563","resolution":{"observed_at":"2026-08-01T18:04:17.133693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:17.291922Z","title":"Momentseeker: A task-oriented benchmark for long-video moment retrieval.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.291922Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:827e97c95f9de6834d0663409c0af9d72bf961fcca1fb08629ebb07c1e205529","observation_id":"d42ee9a0-c770-4fb1-9cee-f1355cd38f45","resolution":{"observed_at":"2026-08-01T18:04:17.291922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:17.406060Z","title":"Tempo-r0: A video-mllm for temporal video grounding through efficient temporal sensing reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.406060Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:0e0e7ea4164d003117ad331c2e8c5f2c5876a1a192c4ba2e509cf1ab04be3f81","observation_id":"945ddabc-103f-452f-b73d-73b697b74dc5","resolution":{"observed_at":"2026-08-01T18:04:17.406060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:17.594384Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.594384Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:20dfab66f3c65548b7acb83d5afe4f25b4acfe8d12554c767dafde9072000393","observation_id":"17b4f512-5a9f-4620-9846-3b6e4d70e7fc","resolution":{"observed_at":"2026-08-01T18:04:17.594384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23224","last_updated":"2026-05-21T09:05:36Z","snapshot_observed_at":"2026-08-02T12:29:31.448544Z","submitted_at":"2026-01-30T17:47:30Z","title":"Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23224","snapshot_observed_at":"2026-08-01T18:04:17.780478Z","title":"Video-o3: Native interleaved clue seeking for long video multi-hop reasoning.arXiv preprint arXiv:2601.23224, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.780478Z"},"links":{"cited_paper":"/paper/2601.23224","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:7352799974596360a7fc9c8a5aded9fcc1b104bac576e03672f0420b39f1022b","observation_id":"f154b320-e218-433b-92d4-f285507ebcde","resolution":{"observed_at":"2026-08-01T18:04:17.780478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:17.948936Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.948936Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:6be0ea6f827fd0bcef5a28cbff8e6396e8700f0baa1d102761369e963bbc7fec","observation_id":"3b760438-77c5-456c-8925-7ea70c3781bb","resolution":{"observed_at":"2026-08-01T18:04:17.948936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:18.065417Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:18.065417Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:68f4c60e1fea19d332c5f6fadba95fe3e34561b490c2d18086e06810a8a5654e","observation_id":"d8aa01b8-baf8-4172-8f68-599747977ac0","resolution":{"observed_at":"2026-08-01T18:04:18.065417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09788","last_updated":"2017-11-21T20:37:43Z","snapshot_observed_at":"2026-07-06T05:35:35.581300Z","submitted_at":"2017-03-28T20:28:52Z","title":"Towards Automatic Learning of Procedures from Web Instructional Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09788","snapshot_observed_at":"2026-08-01T18:04:18.270802Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:18.270802Z"},"links":{"cited_paper":"/paper/1703.09788","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:21c05491e93ff32fd0fe4fc9701db17871081360dce7f4774941c9e11fda7a05","observation_id":"52e74d31-b26b-4bc6-839b-6e6b7971cdc6","resolution":{"observed_at":"2026-08-01T18:04:18.270802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00653","last_updated":"2024-03-31T11:43:39Z","snapshot_observed_at":"2026-08-07T23:43:19.223917Z","submitted_at":"2024-03-31T11:43:39Z","title":"Dual DETRs for Multi-Label Temporal Action Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00653","snapshot_observed_at":"2026-08-01T18:04:18.447131Z","title":"Dual detrs for multi- label temporal action detection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:18.447131Z"},"links":{"cited_paper":"/paper/2404.00653","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:9ff4f04f82bda72fb3bbb291b4225f29caab6f135a5b321eb7a319d3b2f9d8bf","observation_id":"2bdd718f-3b54-4b0b-a075-dc4bac81a7fb","resolution":{"observed_at":"2026-08-01T18:04:18.447131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:18.613378Z","title":"Freeret: Mllms as training-free retrievers, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:18.613378Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:30108567545889014e501f83527fda1a25fbe9db58ef0a453ec44785f3a835a6","observation_id":"b8aa5391-748b-4283-acd0-900dbb0685a3","resolution":{"observed_at":"2026-08-01T18:04:18.613378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08225","last_updated":"2019-04-29T10:08:57Z","snapshot_observed_at":"2026-08-09T15:14:14.469294Z","submitted_at":"2019-03-19T19:30:29Z","title":"Cross-task weakly supervised learning from instructional videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08225","snapshot_observed_at":"2026-08-01T18:04:18.778402Z","title":"When doesqhappen?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:18.778402Z"},"links":{"cited_paper":"/paper/1903.08225","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:39f1f59618420a3ac2033b4e6b172dfec7c28ad1b88ba5485916b5e1cfa29733","observation_id":"e920b1e2-5536-473d-96ae-3b20ea849eed","resolution":{"observed_at":"2026-08-01T18:04:18.778402Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-11T02:24:34.886710Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-01T18:04:15.140313Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.140313Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:ad7e45c9545ab4ab77f001f7ca243e45f759ad8c3a445d1cd03803bae0b3f563","observation_id":"7897806b-4c5e-406a-9871-050898220aa1","resolution":{"observed_at":"2026-08-01T18:04:15.140313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:04:14.449844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:14.449844Z"},"links":{"citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:482cd89b6f639ed5683c8ffdf58a386b79f6ecf6438015dad30f0f5e8420c7d7","observation_id":"134228c4-3783-43b7-a06e-df1c10c2bbd0","resolution":{"observed_at":"2026-08-01T18:04:14.449844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-01T18:04:13.903541Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.903541Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:cebd7b6e9c65ad281c63cdde77ba10299bbb557ae4eed8c5e571db2a9f7230c6","observation_id":"d278cc39-9585-4a08-a17d-ded003675447","resolution":{"observed_at":"2026-08-01T18:04:13.903541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.17423."}