{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:SSV4M5DL5QOWTZ552GTQZUOTE2","short_pith_number":"pith:SSV4M5DL","schema_version":"1.0","canonical_sha256":"94abc6746bec1d69e7bdd1a70cd1d326b21bb65411b7168ae05c1737575d65a3","source":{"kind":"arxiv","id":"2411.11066","version":1},"attestation_state":"computed","paper":{"title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Marie-Francine Moens, Mingxiao Li, Tingyu Qu, Tinne Tuytelaars","submitted_at":"2024-11-17T13:08:29Z","abstract_excerpt":"Recent advances in multimodal Large Language Models (LLMs) have shown great success in understanding multi-modal contents. For video understanding tasks, training-based video LLMs are difficult to build due to the scarcity of high-quality, curated video-text paired data. In contrast, paired image-text data are much easier to obtain, and there is substantial similarity between images and videos. Consequently, extending image LLMs for video understanding tasks presents an appealing alternative. Developing effective strategies for compressing visual tokens from multiple frames is a promising way "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.11066","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-11-17T13:08:29Z","cross_cats_sorted":[],"title_canon_sha256":"181509ea25ec91b3a982bfd8f269cfbd13ab8b0c155d1c39e678fc7487f3fe32","abstract_canon_sha256":"a00d737ac0eb2748adec7cf8ee734b323890d6b7dd15244807fbd17d3bb45106"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:36:28.207264Z","signature_b64":"+WqEPWSHKCWi5VdM8phAwLCatk0RMVFSF+MP1kYvf/TQ+ig3nN8YN7HvqGuoKvHzK2s21Y5PXntYO9pm6dKPCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"94abc6746bec1d69e7bdd1a70cd1d326b21bb65411b7168ae05c1737575d65a3","last_reissued_at":"2026-07-05T09:36:28.206793Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:36:28.206793Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Marie-Francine Moens, Mingxiao Li, Tingyu Qu, Tinne Tuytelaars","submitted_at":"2024-11-17T13:08:29Z","abstract_excerpt":"Recent advances in multimodal Large Language Models (LLMs) have shown great success in understanding multi-modal contents. For video understanding tasks, training-based video LLMs are difficult to build due to the scarcity of high-quality, curated video-text paired data. In contrast, paired image-text data are much easier to obtain, and there is substantial similarity between images and videos. Consequently, extending image LLMs for video understanding tasks presents an appealing alternative. Developing effective strategies for compressing visual tokens from multiple frames is a promising way "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.11066","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.11066/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.11066","created_at":"2026-07-05T09:36:28.206855+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.11066v1","created_at":"2026-07-05T09:36:28.206855+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.11066","created_at":"2026-07-05T09:36:28.206855+00:00"},{"alias_kind":"pith_short_12","alias_value":"SSV4M5DL5QOW","created_at":"2026-07-05T09:36:28.206855+00:00"},{"alias_kind":"pith_short_16","alias_value":"SSV4M5DL5QOWTZ55","created_at":"2026-07-05T09:36:28.206855+00:00"},{"alias_kind":"pith_short_8","alias_value":"SSV4M5DL","created_at":"2026-07-05T09:36:28.206855+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05917","citing_title":"MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03100","citing_title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22078","citing_title":"Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02262","citing_title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19718","citing_title":"Direct RNA sequence design under codon constraints using expressive tensor-based secondary structure models","ref_index":10,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2","json":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2.json","graph_json":"https://pith.science/api/pith-number/SSV4M5DL5QOWTZ552GTQZUOTE2/graph.json","events_json":"https://pith.science/api/pith-number/SSV4M5DL5QOWTZ552GTQZUOTE2/events.json","paper":"https://pith.science/paper/SSV4M5DL"},"agent_actions":{"view_html":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2","download_json":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2.json","view_paper":"https://pith.science/paper/SSV4M5DL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.11066&json=true","fetch_graph":"https://pith.science/api/pith-number/SSV4M5DL5QOWTZ552GTQZUOTE2/graph.json","fetch_events":"https://pith.science/api/pith-number/SSV4M5DL5QOWTZ552GTQZUOTE2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2/action/storage_attestation","attest_author":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2/action/author_attestation","sign_citation":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2/action/citation_signature","submit_replication":"https://pith.science/pith/SSV4M5DL5QOWTZ552GTQZUOTE2/action/replication_record"}},"created_at":"2026-07-05T09:36:28.206855+00:00","updated_at":"2026-07-05T09:36:28.206855+00:00"}