{"as_of":"2026-08-13T13:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a8a2f190dcea69707bb665dcbafe54e1495ac09062c3145e55f3b73ae93e1fe","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:51:17.742891Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:32:17.962997Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:32:18.789296Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"cited_work":{"arxiv_id":"2411.14901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14901","snapshot_observed_at":"2026-08-05T23:32:18.789296Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","venue":"cs.CV","work_id":"6bb1843a-d934-400d-9754-31a72c8c15e8","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.962997Z"},"links":{"cited_paper":"/paper/2411.14901","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:319067b7665f94f2cb23ee0a4dd9c27d86eb1eda0f861216d187ccb92746921a","observation_id":"fbe52eca-4221-4173-a058-749e81744064","resolution":{"observed_at":"2026-08-05T23:32:18.794543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14901/citation-record","integrity":"/paper/2411.14901/integrity","json":"/paper/2411.14901/citation-record.json","paper":"/paper/2411.14901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.629203Z","title":"needle in a haystack","venue":null,"work_id":"b7940a77-2552-44d8-9b16-72c3b10ccc82","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.480428Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:06f021236586e45476633909c3ba84b5021bb63d79eead2182ed9771336a640b","observation_id":"f6de1641-e8d3-49f1-9180-66134e2807f3","resolution":{"observed_at":"2026-08-12T14:51:18.633581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.485527Z","title":"needle in a haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.485527Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:fa3656d74a0ca37e1498a725804a34b44186cedc8d645687928a45b7d634fcfb","observation_id":"14f8428d-d7b1-4c95-9845-40a18e4758a1","resolution":{"observed_at":"2026-08-12T14:51:17.485527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.617415Z","title":"https://sharegpt.com/","venue":null,"work_id":"15437662-b79a-41cf-b00e-e8940d2687de","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.489695Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:afddfe4bed6653f6f9ec561b5a521353e3da168c13ed8629abe2f5c20024a277","observation_id":"932cbd73-d287-489b-86e0-771313651af9","resolution":{"observed_at":"2026-08-12T14:51:18.621707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.606071Z","title":"https://github.com/gkamradt/LLMTest_ NeedleInAHaystack","venue":null,"work_id":"d3854378-d0ea-4981-8868-2ab8b2043307","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.493940Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:b6c199cf055f72c2ff5822a424db1ec021318e769f7b76852ee01d63228818b2","observation_id":"2494fcf0-7316-44fd-8728-03845a06f407","resolution":{"observed_at":"2026-08-12T14:51:18.610355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.594189Z","title":"Lo- calizing moments in long video via multimodal guidance","venue":null,"work_id":"624cd2c2-5690-4725-9499-c62f8ba24d47","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.497775Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:dc21866ab713604793421b70aac39a7dd88331b500dd48f5373369c187b31053","observation_id":"514194ae-6741-4e06-b166-858bb214e022","resolution":{"observed_at":"2026-08-12T14:51:18.598205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.582555Z","title":"Functional brain organization of preparatory attentional control in visual search","venue":null,"work_id":"66d6df9e-d294-4ca0-ba18-3d47368b3b75","year":2013},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.501746Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:369b0f478dd8b3a6644940d168cd298707ad5cc2a078177159520c84e35055e4","observation_id":"70c6f739-fbc3-4dfb-9a5b-18bf90ef7e20","resolution":{"observed_at":"2026-08-12T14:51:18.586723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.505724Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.505724Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:44e4a705ff71ce82740111e8ad6d11d47635c46be25c8cb9904ba5ee8d52153d","observation_id":"c3a58dae-6d8d-4df8-9152-0553858fa38f","resolution":{"observed_at":"2026-08-12T14:51:17.505724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-13T11:37:00.458654Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-12T14:51:17.509494Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.509494Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:fa6609e393a48bede2d8bcc117bcab58e3d64aa5d8346d03c83720a789c5bced","observation_id":"f6a37a7e-6852-4567-ba07-10d991286069","resolution":{"observed_at":"2026-08-12T14:51:17.509494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.563122Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"2e0d38ce-e7a2-4c27-bf7d-0bffdfbe9251","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.513431Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:bfabbd5cf37d367c690d627f16c10a982b79691417d306fc2d350582be13214a","observation_id":"b8ee4b52-d852-41af-b32a-ee00329f0aad","resolution":{"observed_at":"2026-08-12T14:51:18.567451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.551924Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019","venue":null,"work_id":"da14be62-14ae-48e4-a4d8-605a2daabeb8","year":2019},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.516640Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:b3965cf08bc3bf8a7904f934a6aa12ee0eb71448ce811e53cb69a16b8b19439e","observation_id":"8425f23a-9f25-42db-b812-904a74ca0259","resolution":{"observed_at":"2026-08-12T14:51:18.556051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.539363Z","title":"Uatvr: Uncertainty-adaptive text-video retrieval,","venue":null,"work_id":"b17d0fce-819e-4366-b301-73c1bba8fd30","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.519848Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c673a4703a9632c89dca95744f89ad84a41bc77b308e9e6ede496a0ca7dff681","observation_id":"7bfc6ce1-d9db-4510-b89a-3b9e40b894c4","resolution":{"observed_at":"2026-08-12T14:51:18.543891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.527883Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"bcdfebfc-fc4c-4d5b-8e06-1ed75a0f7355","year":2020},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.523083Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c959e12301032c502f3431888535c9f957b0113589735fc15b673dbad0d4eebb","observation_id":"b54cee9a-901a-4e69-b862-fad754abe3e1","resolution":{"observed_at":"2026-08-12T14:51:18.531878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-08-13T11:17:16.685240Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-12T14:51:17.526246Z","title":"Assistgpt: A gen- eral multi-modal assistant that can plan, execute, inspect, and learn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.526246Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:40d07da9e172d47107181d2cad49990662c6acc8753f749cfba570bb1adb1581","observation_id":"d59df371-f9dc-4faf-9877-95bd9c219341","resolution":{"observed_at":"2026-08-12T14:51:17.526246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.516308Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval, 2022","venue":null,"work_id":"16be3a6e-20e2-4e69-b204-2f9a3571b756","year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.529565Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:6bdf9a79dbdb4693e1ec3207dcacab59883bb518f228319172b695bff741ccad","observation_id":"c23fb26c-f5c4-464b-8e35-9534ba353132","resolution":{"observed_at":"2026-08-12T14:51:18.520335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06729","last_updated":"2024-07-13T10:21:14Z","snapshot_observed_at":"2026-08-13T05:05:18.680798Z","submitted_at":"2023-12-11T09:12:35Z","title":"RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos","version":3},"cited_work":{"arxiv_id":"2312.06729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06729","snapshot_observed_at":"2026-08-12T14:51:18.040109Z","title":"RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos","venue":"cs.CV","work_id":"a7f08b73-b248-4ee4-864e-cb30fdd1be1e","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.532531Z"},"links":{"cited_paper":"/paper/2312.06729","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a168e4cab9b80c0b4d087621501dae4afff547d2cada8af5ed5c0cbe6e924e60","observation_id":"bc23c703-d543-4919-8f23-5065e7fcfed0","resolution":{"observed_at":"2026-08-12T14:51:18.046182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10918","last_updated":"2023-05-30T02:03:34Z","snapshot_observed_at":"2026-07-06T13:55:09.054207Z","submitted_at":"2022-09-22T10:58:42Z","title":"CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10918","snapshot_observed_at":"2026-08-12T14:51:17.536220Z","title":"Cone: An efficient coarse-to-fine alignment frame- work for long video temporal grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.536220Z"},"links":{"cited_paper":"/paper/2209.10918","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a8fd05a772ccd7e1bd6a0e342ffa6673df8bf6ba89484eb89b9507537f272f99","observation_id":"255d90f0-9d27-4813-ad21-2f1b032353c9","resolution":{"observed_at":"2026-08-12T14:51:17.536220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T14:51:17.539848Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.539848Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:3082fc80bf99d1ace1ff39b1c5e5d43d03d322935ab385e07a2dfe1e48d5998a","observation_id":"4395324c-3dd4-4766-adfa-b8ea1ccf4037","resolution":{"observed_at":"2026-08-12T14:51:17.539848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.505435Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"22eeb375-7928-4549-bfe6-33d71b5ef869","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.543649Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:12fba7b98fb5f0a8562e00d8cbae09292a8ef2b52449b046b718595c8dfcbd0b","observation_id":"857ffaaa-1626-4923-8342-37e56075e9d4","resolution":{"observed_at":"2026-08-12T14:51:18.509395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-13T00:43:26.044820Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-12T14:51:17.547199Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.547199Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:b1f2dc40846a5c702674505472b760a1d9497f4d5feba5ead76c25b67dad5317","observation_id":"5760acec-746b-45f6-bfbc-d5a67ef8412f","resolution":{"observed_at":"2026-08-12T14:51:17.547199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.494481Z","title":"Audio- enhanced text-to-video retrieval using text-conditioned fea- ture alignment, 2023","venue":null,"work_id":"0ee068b3-ae3b-4ec3-b18e-5392b9a21021","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.551108Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:72d0752efc18a9d3ec31e8325533bf3cc500f8ef5056f1b0dc719319f29212d2","observation_id":"6e092eaf-b30b-4139-ac67-d61fcb73725d","resolution":{"observed_at":"2026-08-12T14:51:18.498330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.483570Z","title":"Efficient long- text understanding with short-text models","venue":null,"work_id":"ad01fc28-9e40-4281-862f-5692f39f5595","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.554425Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:54430d058a0b8e8b15ed1010781883a848798edbcc22437bf6e8a41094670a7c","observation_id":"5fdfe32c-e0ae-4d09-97d9-3009ec7483f9","resolution":{"observed_at":"2026-08-12T14:51:18.487239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.472926Z","title":"Diffusionret: Generative text-video retrieval with diffusion model, 2023","venue":null,"work_id":"839e5762-84da-4904-baf6-4697bd55216f","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.557860Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:d712675a8fb65240f2752b737e36e7b53e48ac32fb19c0a5fcc5ae53269be99b","observation_id":"859ddc87-c4f6-4c55-a492-ae3650642b4b","resolution":{"observed_at":"2026-08-12T14:51:18.476521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.561282Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.561282Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:dcd98953b0994c182edebc4f25f32b880b50d6368267bae1382d45d7bbf7d907","observation_id":"7e84c5c3-f984-47f6-8364-31ec71538ba3","resolution":{"observed_at":"2026-08-12T14:51:17.561282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08391","last_updated":"2025-08-17T19:28:05Z","snapshot_observed_at":"2026-08-13T07:15:24.765895Z","submitted_at":"2024-06-12T16:41:31Z","title":"Large Language Models Must Be Taught to Know What They Don't Know","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08391","snapshot_observed_at":"2026-08-12T14:51:17.565722Z","title":"Large language models must be taught to know what they don’t know","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.565722Z"},"links":{"cited_paper":"/paper/2406.08391","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c47d1cd8669da6e03207ec67f8229fc83ac517c685f0685ab5a47075163a6cca","observation_id":"f31af705-9116-4cde-8097-d2707e6b1939","resolution":{"observed_at":"2026-08-12T14:51:17.565722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14418","last_updated":"2024-02-24T12:30:40Z","snapshot_observed_at":"2026-08-13T04:13:02.689311Z","submitted_at":"2024-02-22T10:04:17Z","title":"Uncertainty-Aware Evaluation for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14418","snapshot_observed_at":"2026-08-12T14:51:17.569740Z","title":"Uncertainty-aware evaluation for vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.569740Z"},"links":{"cited_paper":"/paper/2402.14418","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:7ffcb2e54266be255a397ff1164055ba6434c95dfe864fa6a1b0d1cfeab783be","observation_id":"4f91482b-c689-4763-a06a-5d7a9054805b","resolution":{"observed_at":"2026-08-12T14:51:17.569740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.455107Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"383d3194-26a1-4734-bd9e-d0980af4e499","year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.574528Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:0323afef9bef407f670649e75e8ab30d2379c6a676c69578974a77f71202faa4","observation_id":"1793bfdc-bdeb-44ae-980b-102e7a7189f6","resolution":{"observed_at":"2026-08-12T14:51:18.459089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.578279Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.578279Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:86739a699c71e523280a664952d924346fde1418a671b9b2fffd2f9640342964","observation_id":"46ec3526-134e-46ce-bf8d-cdbd49dce8be","resolution":{"observed_at":"2026-08-12T14:51:17.578279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T14:51:17.582466Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.582466Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:36393faf1dc93277c2b7f1ca2e53aa04c0a14904c22aa3c94c05e7b7a609b948","observation_id":"76d82182-d59a-49bd-8510-a33aeb440e24","resolution":{"observed_at":"2026-08-12T14:51:17.582466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.437541Z","title":"Ground- inggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"7de0f541-6b51-4cb8-a1a4-a54a28260987","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.586499Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:7eae3472ebeee6df52af2bb71907612d9fb62abe9a8116d3ae4c5e5b24133172","observation_id":"2eb60991-0dce-4779-9f93-9019603535f1","resolution":{"observed_at":"2026-08-12T14:51:18.441298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T14:51:17.590376Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.590376Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:0876090e69f2d82bd10adfbee629389b9925d616564911506a1cbf54ed5b189b","observation_id":"cd4f3baa-467a-4ef6-bce8-b42ab4540ad7","resolution":{"observed_at":"2026-08-12T14:51:17.590376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.427054Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"bc9b5f9e-4294-498d-b7e9-f27d5db4cbec","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.594249Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:ee41583be6ef465863123eb6aa0eb5cb1b623c13be134771a8ba219c591a0df8","observation_id":"05cbee80-bb5a-4306-b1f2-fb7b8f0f0578","resolution":{"observed_at":"2026-08-12T14:51:18.430557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:51:17.597917Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.597917Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:7f7e2134c23eea32370855459654b8d5d9cb8ef52a40a058ea930270aa49bc47","observation_id":"39bb5fd4-231b-40aa-a575-3eb309801b08","resolution":{"observed_at":"2026-08-12T14:51:17.597917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00383","last_updated":"2022-09-05T12:27:07Z","snapshot_observed_at":"2026-08-10T17:06:37.895255Z","submitted_at":"2022-07-01T12:48:35Z","title":"ReLER@ZJU-Alibaba Submission to the Ego4D Natural Language Queries Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00383","snapshot_observed_at":"2026-08-12T14:51:17.602209Z","title":"Reler@ zju-alibaba submission to the ego4d natural language queries challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.602209Z"},"links":{"cited_paper":"/paper/2207.00383","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:4454d72d152f6ef2dcd37fd3bb56f3be5dc9f23f4dc06cb6266909db6e989576","observation_id":"34c89be5-11c2-4918-a3c3-3aba6a6ddf88","resolution":{"observed_at":"2026-08-12T14:51:17.602209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-12T14:51:17.605648Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.605648Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:22106f77a1009b9f8f9fc208644711eadcec0c6abab8782c57e80e9f9efe3540","observation_id":"96bdaf0f-68b8-4ce2-b281-74fd7486bc94","resolution":{"observed_at":"2026-08-12T14:51:17.605648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.416715Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"1402b925-525b-4ca2-9c7e-0c24235d86ec","year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.609270Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a89d67bf4863b06b5f708c7228574a1f2be78cd642a30f47444d1d7653d7bf23","observation_id":"353f11b3-9fc8-4847-b641-021352ca4cbd","resolution":{"observed_at":"2026-08-12T14:51:18.420410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.405244Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":"c0e6ab59-9f89-47a8-a82b-cea5aff89306","year":2019},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.612626Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:03c6b0beec4dfa510b5b5519b838a6d310992706b346a7647341879d2d95231e","observation_id":"ab253223-2440-4d2e-9dcf-5f41221f69d6","resolution":{"observed_at":"2026-08-12T14:51:18.409303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T14:51:17.615743Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.615743Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a9936e6f2c7dc68e639d259c1333189ca2026d86e8ceff89a8e4d05a469bb57a","observation_id":"37251822-9afd-464b-9f2f-b3981631e3be","resolution":{"observed_at":"2026-08-12T14:51:17.615743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.394004Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"118115b4-f833-4ae7-bcf4-4ed43c632061","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.618988Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:757a805570e27e121808638c89831bfc296009bbc26f1634e2d5f86ea4040496","observation_id":"19ff04d7-30bc-4f41-b283-d45d25fb7c41","resolution":{"observed_at":"2026-08-12T14:51:18.397946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.382973Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":"673e909f-f059-40f7-81e6-a5dba3dcac75","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.622614Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:cb08b5a0f99259f733af41c65030452df1ced1d5e8213e4c92d6698225f4e66e","observation_id":"ebb83402-3994-44ec-9a7b-18b8f6713bf9","resolution":{"observed_at":"2026-08-12T14:51:18.386923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01723","last_updated":"2024-11-07T06:25:25Z","snapshot_observed_at":"2026-08-13T05:33:40.552198Z","submitted_at":"2023-11-03T05:41:25Z","title":"Towards Calibrated Robust Fine-Tuning of Vision-Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01723","snapshot_observed_at":"2026-08-12T14:51:17.626259Z","title":"To- wards calibrated robust fine-tuning of vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.626259Z"},"links":{"cited_paper":"/paper/2311.01723","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:085e990987f0048da706c81dfd156e473db9fa8163c1be034bdfa3a57781c253","observation_id":"68f00f37-6ea9-412c-aede-02cffb35ab00","resolution":{"observed_at":"2026-08-12T14:51:17.626259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.371812Z","title":"Obtaining well calibrated probabilities using bayesian binning","venue":null,"work_id":"6e2e056d-47bc-47fe-9b2f-c739740c4598","year":2015},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.630348Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:36d26e8497ddd8a72bddfb702b3144761db8adbe7da8e3f40527b3fb2001beab","observation_id":"2d85814d-1246-4674-b31f-fe6f5d6d28f6","resolution":{"observed_at":"2026-08-12T14:51:18.375813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08345","last_updated":"2023-03-22T12:41:03Z","snapshot_observed_at":"2026-08-13T12:24:27.310694Z","submitted_at":"2023-03-15T03:54:43Z","title":"Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08345","snapshot_observed_at":"2026-08-12T14:51:17.634152Z","title":"Scanning only once: An end-to-end framework for fast temporal grounding in long videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.634152Z"},"links":{"cited_paper":"/paper/2303.08345","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:bc21bb9e9d380d578675cbbcd2d9f53fdb7af282f7198084e6ccd402c4b42247","observation_id":"8c9c6ddd-4e66-4dc0-bd29-dfb737e37993","resolution":{"observed_at":"2026-08-12T14:51:17.634152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.358974Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning, 2024","venue":null,"work_id":"73e6a416-19e3-4f12-a82f-ba7560a3f7b6","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.638044Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:dcfcd55594eaedb94c745cf8fad747871a16417fb3bab254b2e6ccb7d6608064","observation_id":"f894d7f6-1da3-4fff-8285-c0f3687dff1e","resolution":{"observed_at":"2026-08-12T14:51:18.363249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.347072Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"8f2ba83d-2fbf-469a-8d0b-faf0dd466698","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.641966Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:0a89e846b69a4845b23c496fdc48644eb12a754dad3a62b89f6ba2b7f5b62ffb","observation_id":"385ffb20-aa04-4efe-9481-fc8712c9a1ea","resolution":{"observed_at":"2026-08-12T14:51:18.351289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.335141Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"25419fb6-a196-4bfc-865e-b19919a76064","year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.645735Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:9c8f1038efa3f7266b125da3833ad233764fb1f8776c872ab00114b320a0bf47","observation_id":"369d7e0f-0aba-4b96-8864-7d0504029881","resolution":{"observed_at":"2026-08-12T14:51:18.339416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.323397Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"cf979dc5-ad86-40b1-bbdf-1a5b016ee9a0","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.649213Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c3befd927e23ef104f67df96a64074fb8fa7b7fbc3deaacd9eaa606665efac11","observation_id":"bd3e9ee6-103f-49aa-92b8-11e2a1e79dad","resolution":{"observed_at":"2026-08-12T14:51:18.327828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.311392Z","title":"Vlg-net: Video-language graph matching network for video grounding","venue":null,"work_id":"a427d44e-86c9-4140-a111-66cb411a0fc0","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.652731Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:6e8da9b14087a7ad67a5fe69d0b60d53f2da7b7f2b80bec2ae0eaaa70fdf52da","observation_id":"fa1786fc-b54f-462c-9a64-d3e8d146a890","resolution":{"observed_at":"2026-08-12T14:51:18.315273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.656723Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.656723Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c105825deb6cfe95dc5b4543fa16c05f9227bd36a84d7ed46bdbd2d0c475fe3f","observation_id":"3cb809b6-898d-4661-918b-d83729b0dc55","resolution":{"observed_at":"2026-08-12T14:51:17.656723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.660574Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.660574Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:5a75de7dda593a0891d25e723b1bf6829d3478eac96c99848fe176e22b48ef76","observation_id":"961da660-c1f6-4d3b-9626-7d6cb1786d99","resolution":{"observed_at":"2026-08-12T14:51:17.660574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.664377Z","title":"Avicuna: Audio-visual llm with interleaver and context- boundary alignment for temporal referential dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.664377Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:794687fcf7fe11a44bfa14aba5d22236954e7de55b034c7202c7c7c2b6eb6782","observation_id":"e7322f6a-c423-4ba0-b032-eb1cf4246819","resolution":{"observed_at":"2026-08-12T14:51:17.664377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:51:17.667958Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.667958Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:6b11d223ca4c0ea34408d19691c387bd4456cf4fcdd83bbf733fed8998161b9f","observation_id":"ec48ea8d-2526-42e0-8254-dd4948a38cd6","resolution":{"observed_at":"2026-08-12T14:51:17.667958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-13T11:53:47.479250Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-12T14:51:17.672191Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understand- ing system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.672191Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a1dce82fa2c164049cde15a274996d0687e1f2564e6666a1495a9e54fe451f9a","observation_id":"65b3fd40-def7-460e-bfd8-1db356291c92","resolution":{"observed_at":"2026-08-12T14:51:17.672191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.675817Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.675817Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:370a06bbf0ba4347d9e82fc267c4bf001f9a6c323cb5095920d6eb5c69fbccc3","observation_id":"a4943ab4-0d48-4b0a-9490-36a41f56a9a5","resolution":{"observed_at":"2026-08-12T14:51:17.675817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.279055Z","title":"Text is mass: Modeling as stochastic embedding for text-video retrieval, 2024","venue":null,"work_id":"ce13296e-30ec-4c22-abc2-289778d83635","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.679428Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:5954fc406f5871f4e82cdc94e44fb4e7dcf33063b2b82d2be59d053138b1c103","observation_id":"f34862bb-cd24-414a-b9a5-ddde6d1215ee","resolution":{"observed_at":"2026-08-12T14:51:18.283505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-13T00:53:32.056724Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-12T14:51:17.683167Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.683167Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:dda6518182f2f8009af991208c6713b0cb27cf781a50232aafcfba1de8955985","observation_id":"09b2e3e7-88b7-464a-aabb-3bfc16f0a067","resolution":{"observed_at":"2026-08-12T14:51:17.683167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.266309Z","title":"Five factors that guide attention in visual search","venue":null,"work_id":"02800ff5-4e5b-47da-9746-106adc273f05","year":2017},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.687158Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:e08eafd9f4e9caae60f47d0ee02a12b6fbf5198612d55fc401fd87b9942d92d8","observation_id":"b96e8328-abb2-4c62-89d9-c9ad92851365","resolution":{"observed_at":"2026-08-12T14:51:18.270664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.254275Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"7ca90fbb-be81-4cb0-98bf-1a92aef1be36","year":2016},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.690819Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:43533344ea4357c54e92999a2e88d0c99f4e295cd66cdcca599377f2666edc4e","observation_id":"33b0a0e2-eeea-45ab-ba58-bc38164d8fb1","resolution":{"observed_at":"2026-08-12T14:51:18.258309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T14:51:17.695172Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.695172Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:db0e3a9b812ee50df748eabc89ecc784a37302416981297141fa39efbd28c407","observation_id":"1a570ca5-d499-4696-9f06-b73cd1f2e861","resolution":{"observed_at":"2026-08-12T14:51:17.695172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-13T07:57:16.456717Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-12T14:51:17.699205Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.699205Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:49f9824d27b30dd75d300426c733badea752ebced248c1b0eb2db2936bcecdb8","observation_id":"3d11ef86-3c09-4298-adee-355fb136229e","resolution":{"observed_at":"2026-08-12T14:51:17.699205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.243029Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment","venue":null,"work_id":"67e37e37-44dc-4ef4-b6f5-f8e118b3d970","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.703027Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:afeac72e308d1bda04afd81b67ba8917464bd447e28a25070367b5bd63938dba","observation_id":"9e40798d-db98-4886-944f-82aedba8fb24","resolution":{"observed_at":"2026-08-12T14:51:18.247005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.231041Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment, 2023","venue":null,"work_id":"d1bc74d6-0634-467c-ab42-c6cb9360ec2a","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.706082Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:d7a0e59d87e08620d78f7008843b7959c3a131d143ba22552d66f2f44b0e4646","observation_id":"6290a9e5-877f-4046-b121-d32a102f6e91","resolution":{"observed_at":"2026-08-12T14:51:18.235064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.219633Z","title":"Vidchapters-7m: Video chapters at scale,","venue":null,"work_id":"d3e0a5c7-881a-424c-9dbc-f4a7b9cd3760","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.709255Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:e9e1dae203725f1ccd4d5a136015ebcd5e2a5b777f263ce5b484d4d0102efc3e","observation_id":"39f0e8a5-21c9-470e-b485-db4f92b1617e","resolution":{"observed_at":"2026-08-12T14:51:18.223591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.207665Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"3d223593-8079-4230-b407-8ae5b5ce535c","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.712563Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:5aad7a1312e4fa4e9c221427b741d9a84b8ccdbcf7727cd09a5a79b2d08f2dd2","observation_id":"c9001ed8-d3d1-4cf2-89d8-19583cb0605e","resolution":{"observed_at":"2026-08-12T14:51:18.212240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.715867Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.715867Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:67a9d0801f6517b42b2acb2056eaa9414bd8057f8eb2ce8ca75f35d79a2fd0f8","observation_id":"fe54dfd1-c547-4831-b9f9-96fa5c24a3a1","resolution":{"observed_at":"2026-08-12T14:51:17.715867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.718994Z","title":"A joint se- quence fusion model for video question answering and re- trieval","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.718994Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:8c0c413ab89f6ae9b77f82f752595c78a4ab6810d7bb46930ef85e8f38aaf227","observation_id":"6dc5565c-50d5-4e59-9bab-48ea7cf2f19e","resolution":{"observed_at":"2026-08-12T14:51:17.718994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.722170Z","title":"A sim- ple llm framework for long-range video question-answering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.722170Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:719b4465f220e9224c1c90ea6a1e95b0ea89709bb746d0de33a5320a35816a38","observation_id":"4db7b359-bc0c-425b-8507-1cbba8219f49","resolution":{"observed_at":"2026-08-12T14:51:17.722170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-13T01:07:23.856467Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-12T14:51:17.726089Z","title":"Span-based localizing network for natural language video lo- calization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.726089Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:eaa3eb9c3a2d67509cb4bee2a9c55aea0e91e4ef72428fbe0c8c32bc88767d5d","observation_id":"11d10cb2-8c7c-4929-a6b0-fef46608327a","resolution":{"observed_at":"2026-08-12T14:51:17.726089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:51:17.730863Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.730863Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:ad1633088f4b78d72518dbb8f2f6e26cfbd85cd09f73a4f2dc36a0de0d4a3a09","observation_id":"b79c7ce4-cf4f-45e0-be7b-fba95f2d2af5","resolution":{"observed_at":"2026-08-12T14:51:17.730863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.175425Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":"80ad4a70-2352-4b97-8fe8-5397b557bb54","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.734969Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:d36efde24c08f2ee0b212b9462b59c648743f6b54a4b446070b2d82dc0ff248e","observation_id":"ed8e90c1-123a-42a6-8552-8f642f137f6f","resolution":{"observed_at":"2026-08-12T14:51:18.179532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.163059Z","title":"Learning video representations from large lan- guage models","venue":null,"work_id":"a83dff67-fce2-4ca7-87c6-cc06ef708273","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.739263Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:1aa6f86246f97182d3efcd61d7b3acb8d5708ca1c6969238af83c7f4cd91603d","observation_id":"4458d16d-b41f-4419-8d00-ddaebcc8bdbc","resolution":{"observed_at":"2026-08-12T14:51:18.167474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.150572Z","title":"<video> Does the <event> happen in the video? Answer yes or no","venue":null,"work_id":"6918c94c-d9b7-4d91-a2e6-b5d65d036ae5","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.742891Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:33a7c2835e7031d412c6dab3d5f5d77a152ba457fe09caaae87bd76b9aa33869","observation_id":"6de24dff-be19-4a52-86a4-6078f8679cf5","resolution":{"observed_at":"2026-08-12T14:51:18.154762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:17:25.829851Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2411.14901."}