{"as_of":"2026-08-08T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bcb94f59eb1f9aa92ba727eb72029578a528c8f0a66116069c5eb5ee505baa0","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:49.012698Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15529/citation-record","integrity":"/paper/2505.15529/integrity","json":"/paper/2505.15529/citation-record.json","paper":"/paper/2505.15529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.664674Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar \\' e n Simonyan","venue":null,"work_id":"a138d243-0011-4351-85a2-00832f718c3b","year":2022},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.435871Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:b66f212c77207b1622deb98e3ec35c39a0c7b70d471260f8c85a17aace13c374","observation_id":"8f111aa1-f365-4e08-a008-587d8d0b50db","resolution":{"observed_at":"2026-08-07T15:20:51.732946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.514469Z","title":null,"venue":null,"work_id":"97f19036-3020-445e-8e6b-1db0ae5990d2","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.511993Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:30a38b8074f85c3425af5e751d575d33681961785d7a2546a4c166ed0024cdbf","observation_id":"4757746a-bce9-4cbc-b8e7-4def18f07d21","resolution":{"observed_at":"2026-08-07T15:20:51.581798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.274171Z","title":null,"venue":null,"work_id":"f0075843-ff1b-4ed2-a8d8-70d7d53193d3","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.586369Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:e38946547cf532521e9de629d2a52627cfddfccf19d99d3cd518a57d5c0875f8","observation_id":"7e5aaeaf-d987-421e-b41d-72332f633ec6","resolution":{"observed_at":"2026-08-07T15:20:51.407479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:20:44.667515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.667515Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:c5a3e1eb7d8cb2b2b062cd25d2e1a600779d6ad372b18490f72079013ae49164","observation_id":"aeb95aec-7c5b-48a8-9143-5c9c25861d5b","resolution":{"observed_at":"2026-08-07T15:20:44.667515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T15:20:44.764951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.764951Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:7bbc5e4e8c907d7d6935a2fe88cb9088b61588e781713b5bd5d37be6148993b8","observation_id":"89c9b623-186a-4330-be78-cabcf333b42b","resolution":{"observed_at":"2026-08-07T15:20:44.764951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:20:44.871031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.871031Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ba4b8f4bee7f7403d0451202379eb86c2ff31e77604387a0e9d268f3fef96cd6","observation_id":"042da8ab-4e83-4132-bc45-8a49da6f3094","resolution":{"observed_at":"2026-08-07T15:20:44.871031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.119828Z","title":null,"venue":null,"work_id":"9011758f-f8e8-41e5-926c-70d2b9e2b0f8","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.997198Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:46855ed075393a3071ea2ae452fad0696ec8c56bfa7f5ef9a967f394ff499fc0","observation_id":"9df7712b-7efb-4210-95f3-c02909292127","resolution":{"observed_at":"2026-08-07T15:20:51.190608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T15:20:45.092112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.092112Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:00c51a3359a5b0c74c73b58132304364aaca5b193d056c4226130027995c655d","observation_id":"6537dfb7-4d62-42b2-8b9e-152561038d2e","resolution":{"observed_at":"2026-08-07T15:20:45.092112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:20:45.191691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.191691Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:6b06440e17193880f565162c50a6ab671622332c6210918a8662ea14df20d0e7","observation_id":"32001848-f00c-4b73-b278-eb58c1f57253","resolution":{"observed_at":"2026-08-07T15:20:45.191691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:45.283481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.283481Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:8a3ac6040c1b63e85dcb9bc80b438b43c481443622f0bb420ba4cbaba4455655","observation_id":"fc5946e2-dd72-48a1-a1bc-98da3fea1e84","resolution":{"observed_at":"2026-08-07T15:20:45.283481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.904892Z","title":null,"venue":null,"work_id":"8db6c8d2-bc2f-4189-a146-3c1722f8f257","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.401124Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:2ad2a37c98cb92f4b9a21bb2bc2c9d98eac0be60849ac356870824405dad9b3c","observation_id":"568b2f86-13e7-4fb3-bedd-e721c409f31d","resolution":{"observed_at":"2026-08-07T15:20:51.011985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.689501Z","title":null,"venue":null,"work_id":"856d059d-2338-46a7-8a1d-7f14c398fbae","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.516975Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:02e8d6705896110230b5bd0c45c23afa81938443dfbd4fc72026a67904c32298","observation_id":"6dcc8ae6-4df9-4b87-a376-5dbf66e45257","resolution":{"observed_at":"2026-08-07T15:20:50.816531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:20:45.618643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.618643Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:f4cca0e49d5642051d91580bd2d96bca5b0c3660f1d1bb68d7ecf29772f07dc6","observation_id":"0833c6ca-2656-44aa-93b4-173aa01292d6","resolution":{"observed_at":"2026-08-07T15:20:45.618643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T15:20:45.733144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.733144Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:5ea5dd29b0021c294aa7e7984539ce7ac690be4eef516fc4d3617a550824d87e","observation_id":"81ccf352-fc30-40ad-a176-ed4d766704f4","resolution":{"observed_at":"2026-08-07T15:20:45.733144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T15:20:45.814866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.814866Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:29f7db8361722e332af02378a62817c080314d643641b293264953add32912b7","observation_id":"69f0435a-ef32-44d7-b5ee-a8290edf9e0f","resolution":{"observed_at":"2026-08-07T15:20:45.814866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:45.926076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.926076Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:b90404ef14b3be50470207be057d0653fb145d2768e7fb402ab2e18dbbc643b9","observation_id":"68cd9ea3-10f6-419d-b479-3cc699219b56","resolution":{"observed_at":"2026-08-07T15:20:45.926076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T15:20:46.025304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.025304Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d2c6921d96ab2d7f993625c9078f64e3cf42b02974d98e9366d162fbb830f29e","observation_id":"5e32be1b-96f0-47c5-a829-3e799dc63adc","resolution":{"observed_at":"2026-08-07T15:20:46.025304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:20:46.130255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.130255Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:1f1c9e6ff5855bbb2d6f0e02cfa0c9e49b39762132fdf0b3da3e248a274ac079","observation_id":"2c42a8a7-e8b0-4b89-a580-674d9dd00723","resolution":{"observed_at":"2026-08-07T15:20:46.130255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.240845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.240845Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:f323f75f2e385d80b4a8990c0614384a7616e14aefbfd9c626cca33d22937705","observation_id":"29148629-9ec8-41a5-8c18-a42e3e65cfc3","resolution":{"observed_at":"2026-08-07T15:20:46.240845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.356809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.356809Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:a665c20a4a0dfa28d63bf0b1a6d63216ba88e943d2798c22b0475a4614b38e56","observation_id":"ccdf8af0-55ec-4984-87a4-2d1ccafd23d7","resolution":{"observed_at":"2026-08-07T15:20:46.356809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.438533Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.438533Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d08c943ddb7212260752b1ef75a25cf6efdf17b71c52a8a30f95cac14a83611c","observation_id":"11bfe300-e9c2-47e6-91a2-4e1d3cdb879a","resolution":{"observed_at":"2026-08-07T15:20:46.438533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:20:46.538312Z","title":"Lillicrap, Jean - Baptiste Alayrac, Radu Soricut, Angeliki Lazaridou, Orhan Firat, Julian Schrittwieser, Ioannis Antonoglou, Rohan Anil, Sebastian Borgeaud, Andrew M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.538312Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:c56a688b21b7b505aa14657e34b90b42ed4112397a5786467b4138e6106191b4","observation_id":"53be6b26-fba9-45f5-9341-c07df4c0678b","resolution":{"observed_at":"2026-08-07T15:20:46.538312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T15:20:46.656613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.656613Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:175aa3e2c951ea2d1904dd5eb5ffbd9531944a8a1d52314a7c64810619ee612a","observation_id":"df10b4bf-19b9-4cc1-9cda-ea7ba31abd8d","resolution":{"observed_at":"2026-08-07T15:20:46.656613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:20:46.774925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.774925Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:33d9f26fa45212fca681dcbca14ccfdc2e7ce48dc7b4b84f1acebfda20cfe5a0","observation_id":"8e97a8a8-ca31-4697-95fb-48e4305a115e","resolution":{"observed_at":"2026-08-07T15:20:46.774925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.882268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.882268Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:5cc2aa95750acbe5df001ab5160b89188f6953018fb2a3e0775841e9f52887ca","observation_id":"4e8687f3-97cb-4618-809d-b22cb0a964e5","resolution":{"observed_at":"2026-08-07T15:20:46.882268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.428242Z","title":null,"venue":null,"work_id":"e94ec6be-4f47-457b-b421-7b705b37bb1d","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.992993Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:53bad50f060bd0ead098eee855e58ef3e5bee77de0c2ca05f723e239b88e6792","observation_id":"52373ded-3d67-44cb-b8ae-820b898f4e2f","resolution":{"observed_at":"2026-08-07T15:20:50.489650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.188303Z","title":null,"venue":null,"work_id":"2ab7d68e-d1f8-4f52-a7b4-ea7de6894b05","year":2025},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.097954Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:7ef0403eb072e2d8487ede4ace8974ba9d9154c69d15ac72cca040ce1ac049d5","observation_id":"e80577a3-53a0-4e6a-b701-074b0ce0ca31","resolution":{"observed_at":"2026-08-07T15:20:50.314362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:49.982662Z","title":null,"venue":null,"work_id":"ea57b19f-ca98-43ac-b333-f63eb3f13e28","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.209607Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:103fe3d58d16455ba66689613f542f3f9641bd4c0d37c96ab551195a4ef031d6","observation_id":"6d1c5864-6482-4522-bde2-8406b87655e1","resolution":{"observed_at":"2026-08-07T15:20:50.061845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:47.360957Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.360957Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:935994faca5a4deda26f0b37ab51b1cacb8bd2543780ae0abf274e9327f87303","observation_id":"65d26525-3b22-4b76-8c52-335ada6560d3","resolution":{"observed_at":"2026-08-07T15:20:47.360957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T15:20:47.442019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.442019Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:65c884a77a0434ec8abd2c65e5024c1e6a227b29f6499b93127d0cd0f147b038","observation_id":"4e19bcb9-4faa-4af7-8a25-9f01f45e34d9","resolution":{"observed_at":"2026-08-07T15:20:47.442019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-08T03:13:28.000968Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:20:47.549466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.549466Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:e30330f605a7705f0a589f9c3d96cf6d4e6ea94cc4b4cf9239b4bfcc8fcb0ecb","observation_id":"0a170583-a703-4bcf-9e43-4138824d1160","resolution":{"observed_at":"2026-08-07T15:20:47.549466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T15:20:47.582468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.582468Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:30465c79b14cc0c920140b93d62ecca29ecfded92eebbab3e0aa232670538d75","observation_id":"504d6f4d-54f0-4a77-8703-264b2636ec34","resolution":{"observed_at":"2026-08-07T15:20:47.582468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T15:20:47.666280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.666280Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:817d1a43e485b084261dad10da88f8fcd0215eb7efeed76b741b5922f52d92e4","observation_id":"3b7b5785-9727-433c-8acf-043e29bc57cb","resolution":{"observed_at":"2026-08-07T15:20:47.666280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:20:47.766618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.766618Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:9dd530d11a53ab712fee7fd662caeccbf6e6e90ab0a552b2901e47d90b866e49","observation_id":"dcf3998a-0299-44c7-99b1-60537273aa35","resolution":{"observed_at":"2026-08-07T15:20:47.766618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-07T15:20:47.848486Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.848486Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:e0211a6e9264786777ccb1c9a6c93be9732c385e4fa3d031ef43ed0f7b2e20af","observation_id":"6123c3b3-0e54-484e-b7dd-3352b9d48e95","resolution":{"observed_at":"2026-08-07T15:20:47.848486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:47.964092Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.964092Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:12dc763f6e0f4a78e9df1070daa887ae46706432849bdee9e8df5c5dd48f6628","observation_id":"b7036e20-0a50-4793-a074-fb882ae4e945","resolution":{"observed_at":"2026-08-07T15:20:47.964092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:48.040187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.040187Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:c649a6bfa41e4fae6e6aa08d3190a97f611b90553accb590e4529ced9d3d482f","observation_id":"b080d67c-5c39-4dbb-8d51-116ecac20bc5","resolution":{"observed_at":"2026-08-07T15:20:48.040187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:48.150431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.150431Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:85d0ef01b5e86652f786204b11340b82225b55af94559ceb3f0a2d5bdeebfa8c","observation_id":"e0f45e9c-7100-445f-a5c3-ea4118e6ebbc","resolution":{"observed_at":"2026-08-07T15:20:48.150431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T15:20:48.289056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.289056Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:c32a91a9a902850613a0d8292d3079aedc81ee99b502a6e54869860fb8ad8119","observation_id":"cdfe6a61-b8c6-4b66-8526-ef453138e929","resolution":{"observed_at":"2026-08-07T15:20:48.289056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T15:20:48.439015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.439015Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:2474d95515becf36f5ade174ea35077e7e0f7ebdcde0c4942ba75c7366574067","observation_id":"0fec3900-d476-4a76-b440-735d2d295676","resolution":{"observed_at":"2026-08-07T15:20:48.439015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:20:48.560323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.560323Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:1171f2c3801f760be3990c18655e3731730519eb5ea95b3389d354ff85bcd7bd","observation_id":"896f522a-1fd3-4c1f-9435-e1462eb735e9","resolution":{"observed_at":"2026-08-07T15:20:48.560323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T15:20:48.669699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.669699Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:75f8fbd74040cbf0df50e442e6e80f86f01e261b865c7898eade9d24c19d34bb","observation_id":"a2c8dda5-b1a7-4752-a01d-d624987f1540","resolution":{"observed_at":"2026-08-07T15:20:48.669699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:49.741017Z","title":null,"venue":null,"work_id":"ab0e5f08-4127-49eb-903a-4e0b7be84ca6","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.791387Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:384727d86dc29905a38dd5627be9071e40c57e8dcbc78047a4421886b98e6f8e","observation_id":"61da8d38-d993-463d-b042-23d06d7753db","resolution":{"observed_at":"2026-08-07T15:20:49.835526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T15:20:48.883282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.883282Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:bef394315c5f990ea5e69baa6acac42cc5c106dd7d3d76098526ba08cd837144","observation_id":"8eacf7cc-13ab-4b30-9181-67af9725b7e1","resolution":{"observed_at":"2026-08-07T15:20:48.883282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T15:20:49.012698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:49.012698Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:57192f408c4781560313580da09079380ab597c77f2088682909e9d14a5b1fdc","observation_id":"20c7a929-9e13-4928-860f-e2097167ac49","resolution":{"observed_at":"2026-08-07T15:20:49.012698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:13:30.827650Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.15529."}