{"as_of":"2026-08-11T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff7a1af7d715da9af3e6781c6deeacc37c8dfc13849c36d6e7cc4c4b9602c813","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:18:18.203170Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:39:26.597389Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15513","snapshot_observed_at":"2026-08-02T04:39:26.597389Z","title":"arXiv:2501.15513 [cs.CV] https://arxiv.org/abs/2501.15513","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16322","last_updated":"2026-07-15T09:37:58Z","snapshot_observed_at":"2026-08-09T21:37:18.308785Z","submitted_at":"2026-07-15T09:37:58Z","title":"GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:26.597389Z"},"links":{"cited_paper":"/paper/2501.15513","citing_paper":"/paper/2607.16322"},"observation_digest":"sha256:aff749115cb2006d84799ffee8f6387fffce5c589eaf7fedd580b74230e76920","observation_id":"ca6bb9bc-a892-4943-a3f2-fc70019a7e86","resolution":{"observed_at":"2026-08-02T04:39:26.597389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15513/citation-record","integrity":"/paper/2501.15513/integrity","json":"/paper/2501.15513/citation-record.json","paper":"/paper/2501.15513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.356749Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.356749Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e4d688be69da3552d967846ec8aa57836668e8ee102f3a1831a6cf85a6b24325","observation_id":"0594859a-02ad-4274-b5cb-675f791c02be","resolution":{"observed_at":"2026-08-10T14:18:17.356749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-11T01:32:16.398082Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-10T14:18:17.386325Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens.arXiv preprint arXiv:2404.03413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.386325Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:2b83da37fc9a12e5061fd28ff3838228bbd88141fdf9367092a76950956dc9e8","observation_id":"8b723536-4ad9-4cf2-a9a7-dd830a5299c9","resolution":{"observed_at":"2026-08-10T14:18:17.386325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T14:18:17.411410Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.411410Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:219913c3fcae4f4efd2102d08f0015de17febc9506167ae428f0dcc5390bf1e3","observation_id":"b8072065-f2ca-4289-aeef-d172b1250d6f","resolution":{"observed_at":"2026-08-10T14:18:17.411410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.788115Z","title":"On attention redundancy: A comprehensive study","venue":null,"work_id":"d68aaa99-3434-4386-9b25-76eeb850e0a2","year":2021},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.446172Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e6ed556ac4f2f2d30c8f63417a6a1fc41b839ea5042549a31a294172ab71d1ac","observation_id":"da7685aa-0d17-435c-8389-f3141c41ff2a","resolution":{"observed_at":"2026-08-10T14:18:18.819859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T14:18:17.464986Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.464986Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:4f687b7333e87c601d9d9ab440b6818e3e8c2b5c530d954823592cd81c0d254c","observation_id":"d0610ac8-318e-447b-a2a3-8986869d718d","resolution":{"observed_at":"2026-08-10T14:18:17.464986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T14:18:17.488069Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.488069Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:c4ba19144f2f13e2e71a031e043d87d0bdd6737e4fd33027ad93526559fc379e","observation_id":"5fde84b7-b003-4cf6-8e4e-75596a287cc8","resolution":{"observed_at":"2026-08-10T14:18:17.488069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T14:18:17.511758Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.511758Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:2e64c9939908b2f602e28469ff4538410f196df8945d82997d61fa4a8af3ebce","observation_id":"c371f93b-dd3b-4003-8e41-3bdd221f361a","resolution":{"observed_at":"2026-08-10T14:18:17.511758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-11T01:31:38.763116Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-10T14:18:17.531656Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.531656Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:77e1d0b0987d3c22962f5aee0f405316b166694f5a4fdf8c23fd527a8a93a1a7","observation_id":"94764db4-f09f-4834-9d11-812e5a47907d","resolution":{"observed_at":"2026-08-10T14:18:17.531656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.549431Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.549431Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:b1c79fb7fca8d63f02ded517a9ecb4ba07c65ecb2996831520fcd086be203f50","observation_id":"1228130b-8da1-477f-8bf7-98b9e7adb483","resolution":{"observed_at":"2026-08-10T14:18:17.549431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-10T14:18:17.558446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.558446Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:9cb4996790e1661b0e38eeed24eed364c32c807eacbb7923ae163086f4ca2d32","observation_id":"2ea93c03-052e-44e2-a882-852655171b02","resolution":{"observed_at":"2026-08-10T14:18:17.558446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.678862Z","title":"Phi-2: The surprising power of small language models.Microsoft Research Blog, 1(3):3, 2023","venue":null,"work_id":"4e72b243-70bb-4884-b867-b8ea10c09107","year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.570633Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:08efcc10445f955827f690a74a3abb1cbe1c6305b4a1dad381848f430fcbd958","observation_id":"ee1e81e6-e1d9-427f-89f6-59ac41686970","resolution":{"observed_at":"2026-08-10T14:18:18.727706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.580777Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.580777Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:df6cdcf8982ec79f5c5fb422a127b202b2648243bac0995fec37c5efa9dfca8a","observation_id":"e7f2384a-558d-4916-b860-04b6f227d507","resolution":{"observed_at":"2026-08-10T14:18:17.580777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-10T14:18:17.592863Z","title":"Otter: A multi-modal model with in-context instruction tuning.arXiv preprint arXiv:2305.03726, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.592863Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:166f047ef1fe20cd6615323dec60ecc1a5a5df94c14d3b84e63f968a1d6fdff7","observation_id":"5035d900-4a80-48fe-97fb-804f35289731","resolution":{"observed_at":"2026-08-10T14:18:17.592863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-10T14:18:17.605226Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.605226Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:cd488ad4f83d910ce109fb688039eccf3fd816b08cc4cbb2a5b9149b5e673983","observation_id":"39898d34-2355-4ed0-82d8-51ca383af8ed","resolution":{"observed_at":"2026-08-10T14:18:17.605226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.618502Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.618502Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:dded732670d57c09b31d09656ba5291a3bff7c1a2ae738e8fdbc76b7343e1b23","observation_id":"07ab9965-e9d8-471e-94ff-916d0f37064c","resolution":{"observed_at":"2026-08-10T14:18:17.618502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.599770Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"a8c27736-f0f9-4262-8f87-6275ad9de3ae","year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.645852Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:1130a84cee2d89329bcf5ce6855373542e87e2f48a86514b04a1c29d83f24e97","observation_id":"584475cf-7c6c-47b5-9226-14e34cbec53e","resolution":{"observed_at":"2026-08-10T14:18:18.618280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T14:18:17.694223Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.694223Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:217c8de20c933f538a765b6758a2535c74391e4db4856112ab90606631e1694c","observation_id":"6334ebe2-a2e4-40c8-a56f-ac9683e0c18d","resolution":{"observed_at":"2026-08-10T14:18:17.694223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-10T14:18:17.735844Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.735844Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:169d534d6583d39493e8689f06d0b01831cced77d29763b9e8f39d855c70b925","observation_id":"d0a71bda-cba0-4041-965d-e16e645a9f62","resolution":{"observed_at":"2026-08-10T14:18:17.735844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.787631Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.787631Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:30f66d216ab24e757990c109c9ff78e058089ac1b4bfe040c9c200beebce57c0","observation_id":"ee1fd6ce-9700-4652-9bbc-78cbd819c634","resolution":{"observed_at":"2026-08-10T14:18:17.787631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.816391Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.816391Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:d31d1f11414023510f47f5cba971872f0e7e3a0cc357223858fa43cd4cb7d3dc","observation_id":"87cf6f5f-bda8-418f-8086-cc2bfa6f68b9","resolution":{"observed_at":"2026-08-10T14:18:17.816391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.576943Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":"f990b2b3-7efe-4b0c-bc16-1f653ba2dcd3","year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.845024Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:607481547291bd124aa657c5594641135d994034bd9f32a2105e03b871841730","observation_id":"72a5ebb0-6080-4aa6-8c4f-b2863db0fc86","resolution":{"observed_at":"2026-08-10T14:18:18.580148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-10T14:18:17.857839Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.857839Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:262108fc2031af1e154bfac659af93e7579666e33d0e8139e698f71e62e0d67b","observation_id":"38287e0a-7220-4daf-9cbd-e6fcfdf0004d","resolution":{"observed_at":"2026-08-10T14:18:17.857839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-10T14:18:17.898432Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.898432Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:9f2d3500f3fcf1c9d5c219dd8538bc408f04235bc27dfc0c6abb2ede1dbed607","observation_id":"1ee46f66-a036-46a2-be2b-a8e42416aa54","resolution":{"observed_at":"2026-08-10T14:18:17.898432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T14:18:17.916023Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.916023Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e3db6dedf20f824880404a441c13e4e0fe5050178eefada15d53a6fd1b160eda","observation_id":"c07d4a9d-4c35-428a-866d-5cca2a9b9ade","resolution":{"observed_at":"2026-08-10T14:18:17.916023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.929562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.929562Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:0bbf08b1f3b21721f7004b5a69d316bb38d8bc4aca1a9070ded918aee018a5a4","observation_id":"94812177-582d-490a-9e94-0bbc74402419","resolution":{"observed_at":"2026-08-10T14:18:17.929562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.934235Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.934235Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:f5fb87a70a7d4720c92d3afccb29bfb35c73c8741361c9c0057addbb3904e3fc","observation_id":"294d4da3-d181-4240-89ef-097f885f3295","resolution":{"observed_at":"2026-08-10T14:18:17.934235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T14:18:17.947719Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.947719Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:77ebf762691712df6d1a5d4d963d1a32b8da629fd7abac99455f467ea0db4cd8","observation_id":"722f96a5-9ef2-4191-b2a7-581d452959de","resolution":{"observed_at":"2026-08-10T14:18:17.947719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-10T14:18:17.964511Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.964511Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:97cb864b0ec62ee205a718c3582148d0cb7f5e6ec7a9ace3af34aa8c6f5d3573","observation_id":"d49048db-9381-46d5-b43a-c05e9d6b6cf5","resolution":{"observed_at":"2026-08-10T14:18:17.964511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-10T14:18:17.977599Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.977599Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:9337317eface2681e0981eed761aa6dda31ab214f954e4b0fd8d07465f0c4e5c","observation_id":"a0a81bc9-a7e6-4d8f-9d69-ee685f2fb426","resolution":{"observed_at":"2026-08-10T14:18:17.977599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.553434Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"43434fe9-4dd2-42ef-9590-562ad87f3056","year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.988770Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:42dc11977c4a9ca62d93462db140c85c27d1183898c96f947e755e2585dcbf86","observation_id":"aa8b79b0-698f-4177-b0f7-7f4bc1b232d7","resolution":{"observed_at":"2026-08-10T14:18:18.557231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.992793Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.992793Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:23fafefea5609fc5c01dfff143876aaceb894b5ea83057614c10c7814c76090a","observation_id":"35d0e1c7-193d-47c4-8c84-d15690c79cfa","resolution":{"observed_at":"2026-08-10T14:18:17.992793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:17.998128Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.998128Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e22f729ca606329226566271161c74bbd822792bf5fe084d9e25e2f812fd3648","observation_id":"a8d7feb4-d9bf-4e6f-bcd9-228401fa8cf8","resolution":{"observed_at":"2026-08-10T14:18:17.998128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T14:18:18.004242Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.004242Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:6ece3bd171ea052b6eaee906d9b4fecaae7249dfe3d3ceacd63ea469ea8eb865","observation_id":"4b280291-3a34-49c4-b416-3ed501db93fa","resolution":{"observed_at":"2026-08-10T14:18:18.004242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T14:18:18.008511Z","title":"Tinyllama: An open-source small language model.arXiv preprint arXiv:2401.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.008511Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:6a28882d8a5ef5c5eda53994f7edd7989be93033ad506b1bb699eeec2a2d5f50","observation_id":"8ef89105-5643-4fc6-b894-96a13c1bc000","resolution":{"observed_at":"2026-08-10T14:18:18.008511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-11T01:31:42.961611Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T14:18:18.012399Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.012399Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:464e162153c2956d6d713fbc1e15b9471446c533d96956a29eb8a44e88712402","observation_id":"86aeb704-3adc-4170-afc5-5eac48021193","resolution":{"observed_at":"2026-08-10T14:18:18.012399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-11T01:31:43.600162Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T14:18:18.042072Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models.arXiv preprint arXiv:2406.08487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.042072Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:a9c0d4906952ae71a24618e45053b432e9930ebc80c7154ca82e419c849d42b7","observation_id":"fe5d7b0f-5675-4012-8c79-da07e7ebffe9","resolution":{"observed_at":"2026-08-10T14:18:18.042072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-10T14:18:18.086229Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.086229Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:e9395724776b4d5c639f800b7e77038c0e1bc9ede1937e6960e5efebc3df379e","observation_id":"7ce12156-d8cc-4ea6-ba88-ee60aab2a8c3","resolution":{"observed_at":"2026-08-10T14:18:18.086229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-10T14:18:18.139242Z","title":"Tinyllava: A framework of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.139242Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:92796f5fb1dc1e01315d081cdb53da386fa4011275bcd0a7dad23fceb8384766","observation_id":"ede505cb-e091-4b28-a534-6a91bffb337e","resolution":{"observed_at":"2026-08-10T14:18:18.139242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-10T14:18:18.168610Z","title":"Attri\",","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.168610Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:fd09c25fc2ddb756af3c5e98a22a79da0df7e4001e7b79aebf648e6a89be4404","observation_id":"4eba6fca-bc13-46c2-9fb9-6984553edddb","resolution":{"observed_at":"2026-08-10T14:18:18.168610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:18.525250Z","title":"The best results are indicated byboldface","venue":null,"work_id":"297a0e81-d3c8-4234-94a5-44fe15bb4ff1","year":null},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:18.203170Z"},"links":{"citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:c97659e1b5781396c5de76f2337f5c4bba56dd8975a30b92199aba8ce44077cf","observation_id":"2216e17b-a605-4ba7-9dc2-b2692de0cbf6","resolution":{"observed_at":"2026-08-10T14:18:18.533114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:10:29.461568Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2501.15513."}