{"as_of":"2026-08-21T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdcb8f8329ef6d1903acd0197a80dc8a9988c3ced1c2e85aa5e4cb4321841d2f","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:44:50.672180Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.436903Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12833","snapshot_observed_at":"2026-08-16T11:46:40.436903Z","title":"Focuschat: Text-guided long video under- standing via spatiotemporal information filtering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.436903Z"},"links":{"cited_paper":"/paper/2412.12833","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:8d0da47f76c5ba3ed0061f1ab57403af80dfab2731ccd4f3a0e3a54368dd9042","observation_id":"4cb02e7a-cd0c-4d8a-aa94-689115e96931","resolution":{"observed_at":"2026-08-16T11:46:40.436903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"cited_work":{"arxiv_id":"2412.12833","doi":"10.48550/arxiv.2412.12833","metadata_source":"pith","pith_arxiv_id":"2412.12833","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","venue":"cs.CV","work_id":"91604187-cc70-4b69-ace5-b9ec3bb773d0","year":2024},"citing_paper":{"arxiv_id":"2607.06481","last_updated":"2026-07-07T16:41:25Z","snapshot_observed_at":"2026-08-15T23:27:36.587662Z","submitted_at":"2026-07-07T16:41:25Z","title":"Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-08T04:31:31.924913Z"},"links":{"cited_paper":"/paper/2412.12833","citing_paper":"/paper/2607.06481"},"observation_digest":"sha256:d7450a21db2034c85aee9bd2f524668c3fba7e9acebb709af66921ac73564ad1","observation_id":"0e828d07-d481-4c27-b553-2541daef71b7","resolution":{"observed_at":"2026-07-08T04:34:31.024844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:53.247907+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:53.247907+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12833/citation-record","integrity":"/paper/2412.12833/integrity","json":"/paper/2412.12833/citation-record.json","paper":"/paper/2412.12833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:49.965596Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:49.965596Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:97da70b77d57272c554431f600955c12e3768a917c106354a80b021ae8b53098","observation_id":"7deb4e54-a544-43cf-9ec6-4ae0d1de3e4e","resolution":{"observed_at":"2026-08-11T13:44:49.965596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:49.972988Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:49.972988Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:b412d0fae4124dd8f1f6df17eb0182dea6779f9d3938ae352440ce97fe089fbb","observation_id":"3be2706f-a41f-4581-80a9-75c517c53179","resolution":{"observed_at":"2026-08-11T13:44:49.972988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05861","last_updated":"2024-05-31T15:22:58Z","snapshot_observed_at":"2026-08-20T01:15:01.756715Z","submitted_at":"2024-02-08T17:50:22Z","title":"Memory Consolidation Enables Long-Context Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05861","snapshot_observed_at":"2026-08-11T13:44:49.986395Z","title":"Mem- ory consolidation enables long-context video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:49.986395Z"},"links":{"cited_paper":"/paper/2402.05861","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:4d489b42e4b2bd22ef2698e89edf52a99a288cc312b851e78c678c925478151a","observation_id":"c21441fc-495e-413e-ade8-ce4e89f3dea1","resolution":{"observed_at":"2026-08-11T13:44:49.986395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:49.996073Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:49.996073Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:b9e572139787ef8c0d9618b28144e445fe4d72616d7ceb5ca83ea17bdd5f8a3b","observation_id":"c36730f4-6ed6-4fee-be05-11bdb36ab249","resolution":{"observed_at":"2026-08-11T13:44:49.996073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T13:44:50.004298Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.004298Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:58a6afc97fee8cac69a566c9dac3f7370df7fc5d045460d2866c15eee7a9c0fe","observation_id":"e07e8417-78d9-4864-b5c2-a8077e335d3b","resolution":{"observed_at":"2026-08-11T13:44:50.004298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.017130Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.017130Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:8b25a75c10e3bd13e0f67749878691938547bbaeb8480aa03abb1cbee2cbc2ef","observation_id":"baf08990-0c88-4e02-a7a9-08728f4048a6","resolution":{"observed_at":"2026-08-11T13:44:50.017130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T13:44:50.026792Z","title":"Videollama2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.026792Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:bb4018aec32608e8486f6a9bd0417f8b64c8f994838d3332a2fb123dd7af7207","observation_id":"ebaf58fb-25de-4edf-af88-ca03f5b24131","resolution":{"observed_at":"2026-08-11T13:44:50.026792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.041938Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.041938Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:64569ab1b2ebb09a7f15aaa859eec16f2f23032e593ea4829caa9dba8c173f24","observation_id":"e3c85fba-9546-4263-8206-8e8ead4454e2","resolution":{"observed_at":"2026-08-11T13:44:50.041938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-11T13:44:50.052198Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.052198Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:838eb4313623580c07252d837a961ca90428ef4a421fc04994f88be48fde21da","observation_id":"f3bf6c2e-3ffa-4700-881f-4528e9510437","resolution":{"observed_at":"2026-08-11T13:44:50.052198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.689490Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":"3f9a41d5-c14c-45c4-b1dc-6e74f406c415","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.058668Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:a7b8dcc0559c9a487c5596e976ceb8587930be0179540dbe08209d001a58b39a","observation_id":"459de546-0dde-49ba-8586-8f548a6d0328","resolution":{"observed_at":"2026-08-11T13:44:52.702135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.663152Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"e504cd75-f990-47be-9c03-6dbb3e192949","year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.064581Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:80002b6e30564e5ed680439041382e33f64dd48fbf2400d906de83770abc319b","observation_id":"42793921-42a3-4e57-ac57-e495bf7b8f8b","resolution":{"observed_at":"2026-08-11T13:44:52.672190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.639038Z","title":"Egovqa-an egocentric video question answer- ing benchmark dataset","venue":null,"work_id":"f01e8c59-65c7-4ab6-8953-debef8bdd79c","year":2019},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.069806Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:d7ab14712180aa4f1f75b225686c4bc879e4d1f9b2d5fa7dd0ad5198cff0a2d6","observation_id":"39776e8a-ce3f-4fb6-b1a0-b2a823373b02","resolution":{"observed_at":"2026-08-11T13:44:52.649998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.618399Z","title":"Eva: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"a7ad438f-a2bb-44c1-b119-29b01eb47e5d","year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.082700Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:d27eaee6393b9cd64342d5181cf62b0046b8d4e639aad95f7ec140b05311b048","observation_id":"ecacce4a-9f99-4463-b9bf-3f7744a82d22","resolution":{"observed_at":"2026-08-11T13:44:52.624327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.597891Z","title":"An empirical study of end-to-end video-language transformers with masked vi- sual modeling","venue":null,"work_id":"371d3260-be41-488d-aded-5394f17a5ec1","year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.088868Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:d892b12bcc541fd44076aed6fb19b411ff0868a2acedd959c9e333a1bd1fcd11","observation_id":"c3d9022f-9226-42e2-9a86-01c96d77e172","resolution":{"observed_at":"2026-08-11T13:44:52.603947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.575936Z","title":"The faculty of language: what is it, who has it, and how did it evolve? science, 298(5598):1569–1579, 2002","venue":null,"work_id":"1c3fc2ff-2e1f-4d05-9be0-4abc3d273052","year":2002},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.098603Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:aa6fbe915db4e47a17db883979607a2d6f34b8397f6d0cfcd6bb1945092aa0cd","observation_id":"5505f809-a4e5-421c-9ce2-9e63472a52d2","resolution":{"observed_at":"2026-08-11T13:44:52.583196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.554180Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"e760b02c-ec6c-4952-bc1d-ad8d2891ddd9","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.104176Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:8a58e2dec5b82fc7633cbe216f7fae2e9c2ae7713ab59514836f58cefce5d224","observation_id":"7cf23d61-6dcd-4c4e-b4bb-ede4d7c5d4af","resolution":{"observed_at":"2026-08-11T13:44:52.559863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T13:44:50.116939Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.116939Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:52f7390ba16cde227b74d820eb079ad9ba5019b31aeb1310ddb303c9fa385d0b","observation_id":"58ad06cc-9093-4e80-ba80-1d5356e57f6d","resolution":{"observed_at":"2026-08-11T13:44:50.116939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.530336Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"bf009562-6eb6-4770-9d2c-aa72af3cc900","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.129443Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:dc9fa5e52b1101fc3c2519b5883774eb95adf25c464c2acc129922e120b10f14","observation_id":"5e83701a-aab5-4b91-ae2d-0fce57c80f23","resolution":{"observed_at":"2026-08-11T13:44:52.540885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-20T04:13:15.665379Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-11T13:44:50.143816Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.143816Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:fffb055d4f8b708a3084199fc859b265301b9ef1cc20b09de383bcc70ec62f5d","observation_id":"e49bfb55-3144-4a2f-b33b-59b8d134b026","resolution":{"observed_at":"2026-08-11T13:44:50.143816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T13:44:50.152682Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.152682Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:cf408ded73c8b3116f442eaa0af33635acbd385febe65b05cc00951993397fb8","observation_id":"730ded9d-3710-4b50-a4b5-2f055009d5b3","resolution":{"observed_at":"2026-08-11T13:44:50.152682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.162208Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.162208Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:024bcd08f32c4662765faf3c08630912d0d1e07fe5a2b1463ad337020389ff8e","observation_id":"fbc6bf7b-8517-413f-9621-03f0cf75958d","resolution":{"observed_at":"2026-08-11T13:44:50.162208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03428","last_updated":"2022-06-07T16:28:30Z","snapshot_observed_at":"2026-08-16T16:54:41.012342Z","submitted_at":"2022-06-07T16:28:30Z","title":"Revealing Single Frame Bias for Video-and-Language Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03428","snapshot_observed_at":"2026-08-11T13:44:50.169552Z","title":"Revealing single frame bias for video-and-language learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.169552Z"},"links":{"cited_paper":"/paper/2206.03428","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:441f555d446af6f70c386b8ae4c8203c17b9ff62dd6a1e308a61e7736088dbfe","observation_id":"b9ccc714-7929-4e32-bee2-724ade01dcd7","resolution":{"observed_at":"2026-08-11T13:44:50.169552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.423675Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0d7f1151-1ba2-4021-9f65-c23f55cdb0e9","year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.180145Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:c7a50fc78ec307bd0e2be3d6ace072a7d68a79add5bc1785aa7cc48e8f682b15","observation_id":"5b289956-d3ba-4c97-b720-a1299016f50c","resolution":{"observed_at":"2026-08-11T13:44:52.456643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T13:44:50.188674Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.188674Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:db43d3ff96f588a331b013fae75ab3e499345d08cbca447631cbb7538be80fae","observation_id":"f605c85a-e8f9-4e88-8dd3-3541048d8410","resolution":{"observed_at":"2026-08-11T13:44:50.188674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.197811Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.197811Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:b8fbae4010f5e46ebacf836a94628897ec8010e81912386b090d1d6274136c37","observation_id":"d2712700-82b0-4fc0-8d28-6e25ba04c1da","resolution":{"observed_at":"2026-08-11T13:44:50.197811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.363719Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"578d932f-06c5-4ab2-ab71-f6b18e2620b6","year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.207634Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:0422b59f4044d733108bc973d067f9b1ffbf3f348e1be8dc895034176d4f53df","observation_id":"bca4a85f-1150-4670-9679-34d68d7426aa","resolution":{"observed_at":"2026-08-11T13:44:52.371539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-19T07:53:42.767456Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-11T13:44:50.214223Z","title":"Densefusion-1m: Merg- ing vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.214223Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:45feb4909b6cf04af9593fee75ee484e0d7fa28e7c02283a8021b4f67034bbb7","observation_id":"96801e0e-8f50-450f-b028-6908cc30c484","resolution":{"observed_at":"2026-08-11T13:44:50.214223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.219545Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.219545Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:83234a8f40b0767e0ee67774c71a72e99264e7eb82706288f0b61f8b2c1c3fb0","observation_id":"8446f119-07ab-4432-b5aa-d7509bc90b28","resolution":{"observed_at":"2026-08-11T13:44:50.219545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.314592Z","title":"Invariant grounding for video question answering","venue":null,"work_id":"27acb1cf-4a69-42c8-b400-161be390ff7c","year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.224643Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:a9951bb2aee8b34acb1865121162d57ed965fde0b51762e002a707e5cef3cdec","observation_id":"b7821931-0fb9-40ea-bf10-beb77dd26734","resolution":{"observed_at":"2026-08-11T13:44:52.324152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.230391Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.230391Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:7bc78e724b1bb405a465566b00889cea0c54833645e45a2640d5b90aee885342","observation_id":"9e6bce0e-dd50-408a-aed7-b0a6e70f14f2","resolution":{"observed_at":"2026-08-11T13:44:50.230391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16209","last_updated":"2024-04-02T01:57:00Z","snapshot_observed_at":"2026-08-16T14:06:56.080107Z","submitted_at":"2024-03-24T16:08:10Z","title":"Image Captioning in news report scenario","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16209","snapshot_observed_at":"2026-08-11T13:44:50.236627Z","title":"Image captioning in news report scenario","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.236627Z"},"links":{"cited_paper":"/paper/2403.16209","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:a9ab68f92d8d05b5a49fb6922b9ba9d8bf4070ecc1cdddc486a4a546a078c0b8","observation_id":"70e1b3fc-56d0-42da-9e53-68b7fae9adba","resolution":{"observed_at":"2026-08-11T13:44:50.236627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T13:44:50.253627Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.253627Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:3e205a5310d63d4a109c578419d540d48d2a2f72b39d3c05b144f9d166eda82e","observation_id":"f1a3515d-bb66-45f2-ae1a-6a6050f1e808","resolution":{"observed_at":"2026-08-11T13:44:50.253627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T13:44:50.260820Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.260820Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:2fc4033eba25af6aaccf34d18bc965adc81698e75e3404b6cef70d8b17d3f046","observation_id":"b85211e8-21e5-4408-9977-0f9a05d48c3c","resolution":{"observed_at":"2026-08-11T13:44:50.260820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-11T13:44:50.268438Z","title":"Clip- cap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.268438Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:c930cc3a557892bcab4f579b7a6fcd0827f3330018db449155f5b42260b30765","observation_id":"6f8ce990-2b20-43c6-b479-97139a1ae00f","resolution":{"observed_at":"2026-08-11T13:44:50.268438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.257781Z","title":"Introducing chatgpt","venue":null,"work_id":"a6a144e5-6b3b-40e6-b4fa-a9d4228d0034","year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.275019Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:d4fa76a971ee8bb01b9593443445cf23b66a9a7db83aee85b1d9a2f4cb467a98","observation_id":"1e77a4b0-b44f-41a9-a51e-b03d7320effb","resolution":{"observed_at":"2026-08-11T13:44:52.274398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T13:44:50.287494Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.287494Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:a948a7857d4423f0f5114ffa13cf9d61b136166a19b3a4e2dfe22b96c0468ca7","observation_id":"42b513cb-85b4-4f4f-9b4a-7939a07d9b88","resolution":{"observed_at":"2026-08-11T13:44:50.287494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.218323Z","title":"The language instinct: How the mind creates language","venue":null,"work_id":"9d5fa6b2-93c7-488a-a78c-33c4dcf272a0","year":2003},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.295917Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:582d4e7eacd18c4563c858955082ecabb662eb06a2447a16ef940341a50aa5cf","observation_id":"d5f55249-37c0-45a3-9733-bd3b24ec8439","resolution":{"observed_at":"2026-08-11T13:44:52.228315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-08-16T13:49:34.484002Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-11T13:44:50.302367Z","title":"Streaming long video understanding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.302367Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:cfb54247e3c42ff956239b6c667a6cd4341dc4505f4002aa84cd701493f48f9b","observation_id":"3d4344dc-e917-48a8-9db2-96f9fb52e066","resolution":{"observed_at":"2026-08-11T13:44:50.302367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.311340Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.311340Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:ec8c85d63dc343fb5f4d941f3cfc0a30e3e0e02575aa5eb1ea6f3260d7d1888c","observation_id":"f0f7bcc5-b8db-4543-96b7-a2f3ec1cc135","resolution":{"observed_at":"2026-08-11T13:44:50.311340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16998","last_updated":"2025-06-11T17:46:56Z","snapshot_observed_at":"2026-08-20T15:07:47.842237Z","submitted_at":"2024-03-25T17:59:09Z","title":"Understanding Long Videos with Multimodal Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16998","snapshot_observed_at":"2026-08-11T13:44:50.317635Z","title":"Understanding long videos in one multimodal language model pass","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.317635Z"},"links":{"cited_paper":"/paper/2403.16998","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:22f7090043ac8a46379ebb772ec0ca0f9c4d42db1b39ea834442ace9e5b46d22","observation_id":"b4cf9ec3-f3d7-4196-b36c-00a50127b88e","resolution":{"observed_at":"2026-08-11T13:44:50.317635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.158492Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"b6315fc2-bf73-4aed-9300-1c3a5bd2407d","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.329655Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:f0200e30c43518c2548c2d8a827e8229e1a4d3307080b1f2e13d83c6680dd608","observation_id":"c47738b6-95eb-42db-ba9f-0139b38ed4b8","resolution":{"observed_at":"2026-08-11T13:44:52.170911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.116597Z","title":"Fusecap: Leveraging large language mod- els for enriched fused image captions","venue":null,"work_id":"072a5287-c10a-4c2d-9618-c60c486613d4","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.338125Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:38241c35dab034b37eca64433ab4481cbe73bb214f7723bfc8f955344c72b13a","observation_id":"129f7344-ec23-4378-b47d-8a072dd77879","resolution":{"observed_at":"2026-08-11T13:44:52.125471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.082666Z","title":"Talking about large language models","venue":null,"work_id":"dccbefa7-373b-42e6-9bc1-b118b7407a58","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.352522Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:305f0cfbda1f4a2d4a4692b4e1833531ffd61ca1c9a8d76509cb3755a6a4e825","observation_id":"8380ebfa-8481-47a7-ab0d-9282dc5caa99","resolution":{"observed_at":"2026-08-11T13:44:52.095985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.049535Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"a0f413b8-e7c2-4683-8b3b-002fcd1beb68","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.368163Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:4325e379bb6f004c0c06fb43ddb3485ccb72cc351587844d22eb1f9424da9a83","observation_id":"77f71f1d-843c-4dfd-b58e-b38000e6fa67","resolution":{"observed_at":"2026-08-11T13:44:52.058154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01422","last_updated":"2025-08-11T12:47:49Z","snapshot_observed_at":"2026-08-16T14:13:23.468189Z","submitted_at":"2024-03-03T07:43:39Z","title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01422","snapshot_observed_at":"2026-08-11T13:44:50.378668Z","title":"Moviellm: Enhancing long video understanding with ai-generated movies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.378668Z"},"links":{"cited_paper":"/paper/2403.01422","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:5ba8e03a2fb283f46063f7adf0530fde4b4d365b15294e9a92462c0779973f19","observation_id":"bd70c989-4d89-496d-8f9a-fa1479aa1f85","resolution":{"observed_at":"2026-08-11T13:44:50.378668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:52.015772Z","title":"Koala: Key frame-conditioned long video-llm","venue":null,"work_id":"b8eb3693-e0e8-4e67-bb0a-4b8873f51422","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.399514Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:cde86763e9afd3cc42f2899a51c7f460a6b842c847b585c088fa0d750d083e82","observation_id":"24f70b62-e83e-48ee-a573-1d3d39749a8c","resolution":{"observed_at":"2026-08-11T13:44:52.028251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-11T13:44:50.415820Z","title":"Galactica: A large language model for science","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.415820Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:2545f70d88d80d1f91b45a593106f3bcd879bc3e605fbc2f855e589663ad7255","observation_id":"b6df8fd2-1875-498d-968d-5377f094bf1d","resolution":{"observed_at":"2026-08-11T13:44:50.415820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T13:44:50.427239Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.427239Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:cf50f9b7be2a26ac2c8ba6fd92f1f178ece49bc69d7fb6a4aca72ac5ec2fea43","observation_id":"8f02d7a7-a679-4bfb-ab42-cabd6dd4f453","resolution":{"observed_at":"2026-08-11T13:44:50.427239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T13:44:50.435738Z","title":"Llama2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.435738Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:bd570115bdda848683d874d84143eb5f583fef2ab3dc5a3eb590683c70d6568d","observation_id":"85b72e60-54db-4ba4-a526-492fda7f5264","resolution":{"observed_at":"2026-08-11T13:44:50.435738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.982922Z","title":"Computing machinery and intelligence","venue":null,"work_id":"1bf592f7-e5e1-482e-8a98-570c68f2d595","year":1950},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.446592Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:d50425f7a9977406a180a1e04ea16a116830849e82948f8cd5219f3bd1da07d4","observation_id":"1bc027d8-1995-4db6-b25b-3a116ff609c0","resolution":{"observed_at":"2026-08-11T13:44:51.993008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.453453Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.453453Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:884dfc26f0367a04de76ed9b3c5c6f65edf9435e158fcc9fd3bea47cb81475f9","observation_id":"f2c664a1-9aac-49a4-9801-7c29e34152d5","resolution":{"observed_at":"2026-08-11T13:44:50.453453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-20T14:00:35.783346Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-11T13:44:50.459739Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understand- ing system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.459739Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:83a2902850520c1152fc61f721ab50cfeee3d9db80f8d52dc39e0cf751b7ecad","observation_id":"d70177a6-aa19-42c0-9f6a-30dd8af9135f","resolution":{"observed_at":"2026-08-11T13:44:50.459739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-20T03:47:10.217701Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-11T13:44:50.468860Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.468860Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:4e9f8f84319d774b00b71a64085807b7b4edb2b80f50206d7a22690e74e10d29","observation_id":"27daf447-93fd-489f-96da-22433a18bbbc","resolution":{"observed_at":"2026-08-11T13:44:50.468860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.476422Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.476422Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:73a67538ed8b719bc73d2020d70be79136b5d3acd5a2d32331bde57d9089c7d3","observation_id":"36d93877-eaca-47ca-95b2-7fefe806919c","resolution":{"observed_at":"2026-08-11T13:44:50.476422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-11T13:44:50.497730Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.497730Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:3e308bfd8d17a06c3e5c76ac73b024ea9b38932f99dbe728b091493e8c51fbe4","observation_id":"168359ec-92d4-4ff7-be2d-8a08834f87b4","resolution":{"observed_at":"2026-08-11T13:44:50.497730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.912559Z","title":"A large cross- modal video retrieval dataset with reading comprehension","venue":null,"work_id":"f8ca9738-c1e3-4ef3-a774-9ff305afdad4","year":2025},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.517706Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:8dfd6a93247da3da1829e304ba4fc853f92f3c6a1cdf08dcf9fb05d5ab74f2fb","observation_id":"59c53a00-e26c-4fc3-ad06-d19b9a5aba0a","resolution":{"observed_at":"2026-08-11T13:44:51.923186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.886413Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"751a8080-cd77-41f6-9c8a-d4b7a1a99272","year":2021},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.527453Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:1d1e13ae91da9f628cc2951f4fe4203d25a0388a04bd104616a2badb5f5e716f","observation_id":"1bce6f61-334e-4adc-b45a-892d1cfe4f3d","resolution":{"observed_at":"2026-08-11T13:44:51.894177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.863098Z","title":"Video as conditional graph hierarchy for multi-granular question answering","venue":null,"work_id":"9da1d541-da59-4bcf-9607-abbea67378d4","year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.551545Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:5c1bba6608c1006e70bc876ff48e72ead987d8eff8a65d105788783368de9df7","observation_id":"16e2c91b-832e-470d-8db2-dcfbb173dadd","resolution":{"observed_at":"2026-08-11T13:44:51.869532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.561368Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.561368Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:a9f1b3cd6ca2c42792fe9ecbb23ed784a0b81fa13616e89fd818ff7bd23a5ac1","observation_id":"e4ffe5f4-c9d2-42ec-a1d7-bcd935e56afb","resolution":{"observed_at":"2026-08-11T13:44:50.561368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:50.568823Z","title":"mplug-2: A modularized multi-modal foundation model across text, image and video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.568823Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:8f9750500c5184706a466e527a600845bfb07436277183809c60da343ed0d39b","observation_id":"7ac0a1a6-b20a-4c90-a3ac-a3664442ae4e","resolution":{"observed_at":"2026-08-11T13:44:50.568823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-11T13:44:50.577987Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.577987Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:9058716b1ae16525679253366b86b047c6b2d50f82ecdda557151754e91dc8d0","observation_id":"2645119b-22bc-472e-8c14-06d5518652da","resolution":{"observed_at":"2026-08-11T13:44:50.577987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-20T14:58:48.565984Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-11T13:44:50.583896Z","title":"Videococa: Video- text modeling with zero-shot transfer from contrastive cap- tioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.583896Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:462ab8d1b24c33dd640801185ad9f7e3124f6d82376c017855044c8229f5a7e9","observation_id":"eb13a480-ead0-4234-ab84-56823a11744e","resolution":{"observed_at":"2026-08-11T13:44:50.583896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.797622Z","title":"Just ask: Learning to answer ques- tions from millions of narrated videos","venue":null,"work_id":"46bdb226-ddcf-4d76-b627-a5190018da50","year":2021},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.593654Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:743daccdcc3cc189b728d70e51c108f6c6ab9027c4a904ca68b42e9423e12cdf","observation_id":"df907a64-66ec-4748-a479-99be86623005","resolution":{"observed_at":"2026-08-11T13:44:51.804454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.775263Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":"7e3ae7c3-f7f7-4343-b0c8-5b06f5f2f5eb","year":2022},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.602419Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:4f5098fbf25ba087c3f9ad58aa78ce432bf701a449594ec789b53dfc3442e2ef","observation_id":"e89c310c-625b-48ae-af7f-6b72aac62960","resolution":{"observed_at":"2026-08-11T13:44:51.781688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08392","last_updated":"2025-03-06T03:27:02Z","snapshot_observed_at":"2026-08-20T14:00:41.009286Z","submitted_at":"2024-01-16T14:33:09Z","title":"DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08392","snapshot_observed_at":"2026-08-11T13:44:50.610768Z","title":"Doraemongpt: Toward understanding dy- namic scenes with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.610768Z"},"links":{"cited_paper":"/paper/2401.08392","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:736c75ec119a4cfeb94daa100cfde3e2c9f74bb8d6d1e42a7b02a2379c820c67","observation_id":"c8cbdc7d-43b5-4171-a8d2-750e90176b8d","resolution":{"observed_at":"2026-08-11T13:44:50.610768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.754143Z","title":"Hitea: Hierarchical temporal- aware video-language pre-training","venue":null,"work_id":"e86a36c7-e96d-4788-9e1e-cda0b29c26c9","year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.618288Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:6e5f7f2bd582822b8bbc8fa7c392b45f6f60d4aa9d62adb39e29cf46f7bfcc6c","observation_id":"a7a8556c-9426-4a4b-a846-eb87ab881c96","resolution":{"observed_at":"2026-08-11T13:44:51.759999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-11T13:44:50.626507Z","title":"Clevrer: Collision events for video representation and reasoning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.626507Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:2100c4c4380807898f652a512594224345e2a50087ffe8089539e1690f35e8af","observation_id":"5613c14b-5b87-482b-88e4-6f3b69eb3f1d","resolution":{"observed_at":"2026-08-11T13:44:50.626507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.730674Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"8c27f916-7d78-4617-8902-9ed680b71cb6","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.639033Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:079dd121c13b0a7cb1293f1bf125fbae0362a4e5461143275e459e797ba23cfa","observation_id":"add73827-01e9-40e2-a263-df818fe155c7","resolution":{"observed_at":"2026-08-11T13:44:51.738864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.690980Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"c291649b-66fa-4490-baa3-7729ac801177","year":2019},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.645539Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:315861dbafb7d6aa85b0e0c04f40ad71b7fb3c73e5bdb29104b5431c580df467","observation_id":"1e15c84f-a3f7-4480-a4c2-9413a1cb7b0d","resolution":{"observed_at":"2026-08-11T13:44:51.702530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T13:44:50.656933Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.656933Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:660ac6f5775c62625e76be4a23b84e54cb8e1ae21d8c23f7f9e4ea559cb39908","observation_id":"1dde4ae7-c105-4d57-9d7d-fbfb707794a0","resolution":{"observed_at":"2026-08-11T13:44:50.656933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:44:51.652367Z","title":"Streaming dense video captioning","venue":null,"work_id":"e2d0fb5e-4287-47a8-8887-3e9c2f844255","year":2024},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.664971Z"},"links":{"citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:423ee65e109483dd460d8deab08b95807cd13a5f40f6edcb613ccde614a4373f","observation_id":"a2b53762-26be-46d9-bf18-8476c458ca29","resolution":{"observed_at":"2026-08-11T13:44:51.660449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T13:44:50.672180Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T13:44:50.672180Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.12833"},"observation_digest":"sha256:7907a0278c96fdde529262ce4153f86cf36f9585ead7116ddff092add8b78b42","observation_id":"8732139d-07c6-4e1d-8a75-29f261e19278","resolution":{"observed_at":"2026-08-11T13:44:50.672180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12833","last_updated":"2025-05-28T09:22:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:29:45.962675Z","submitted_at":"2024-12-17T11:54:47Z","title":"FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2412.12833."}