{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:B4EX4JW6AKNOJOCILNW3AIET2U","short_pith_number":"pith:B4EX4JW6","schema_version":"1.0","canonical_sha256":"0f097e26de029ae4b8485b6db02093d52c6ccca0dd3efa949e64307dcf5b42ed","source":{"kind":"arxiv","id":"2502.13363","version":1},"attestation_state":"computed","paper":{"title":"Pretrained Image-Text Models are Secretly Video Captioners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Chunhui Zhang, Soroush Vosoughi, Yiren Jian, Zhongyu Ouyang","submitted_at":"2025-02-19T01:53:03Z","abstract_excerpt":"Developing video captioning models is computationally expensive. The dynamic nature of video also complicates the design of multimodal models that can effectively caption these sequences. However, we find that by using minimal computational resources and without complex modifications to address video dynamics, an image-based model can be repurposed to outperform several specialised video captioning systems. Our adapted model demonstrates top tier performance on major benchmarks, ranking 2nd on MSRVTT and MSVD, and 3rd on VATEX. We transform it into a competitive video captioner by post trainin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.13363","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-02-19T01:53:03Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"892734b7dd7200458b395bbbd95e3f92695b873c80af785b8545491392f643fb","abstract_canon_sha256":"b8ddddff0736c2b6bdd59a6cf4ecf98433c159e989892744fd0bb5599746e557"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:16:45.943493Z","signature_b64":"oxW6GCIsmJwElBkMZTlLV5sN13TbQYeKqbYj7k1cMDREjafGeDDtourdOzI9sBL1bzRU1jZnu8Hmpl40ZDpVBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0f097e26de029ae4b8485b6db02093d52c6ccca0dd3efa949e64307dcf5b42ed","last_reissued_at":"2026-07-05T10:16:45.943004Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:16:45.943004Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Pretrained Image-Text Models are Secretly Video Captioners","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Chunhui Zhang, Soroush Vosoughi, Yiren Jian, Zhongyu Ouyang","submitted_at":"2025-02-19T01:53:03Z","abstract_excerpt":"Developing video captioning models is computationally expensive. The dynamic nature of video also complicates the design of multimodal models that can effectively caption these sequences. However, we find that by using minimal computational resources and without complex modifications to address video dynamics, an image-based model can be repurposed to outperform several specialised video captioning systems. Our adapted model demonstrates top tier performance on major benchmarks, ranking 2nd on MSRVTT and MSVD, and 3rd on VATEX. We transform it into a competitive video captioner by post trainin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.13363","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.13363/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.13363","created_at":"2026-07-05T10:16:45.943056+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.13363v1","created_at":"2026-07-05T10:16:45.943056+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.13363","created_at":"2026-07-05T10:16:45.943056+00:00"},{"alias_kind":"pith_short_12","alias_value":"B4EX4JW6AKNO","created_at":"2026-07-05T10:16:45.943056+00:00"},{"alias_kind":"pith_short_16","alias_value":"B4EX4JW6AKNOJOCI","created_at":"2026-07-05T10:16:45.943056+00:00"},{"alias_kind":"pith_short_8","alias_value":"B4EX4JW6","created_at":"2026-07-05T10:16:45.943056+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.01319","citing_title":"Learning Sparsity for Effective and Efficient Music Performance Question Answering","ref_index":77,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U","json":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U.json","graph_json":"https://pith.science/api/pith-number/B4EX4JW6AKNOJOCILNW3AIET2U/graph.json","events_json":"https://pith.science/api/pith-number/B4EX4JW6AKNOJOCILNW3AIET2U/events.json","paper":"https://pith.science/paper/B4EX4JW6"},"agent_actions":{"view_html":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U","download_json":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U.json","view_paper":"https://pith.science/paper/B4EX4JW6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.13363&json=true","fetch_graph":"https://pith.science/api/pith-number/B4EX4JW6AKNOJOCILNW3AIET2U/graph.json","fetch_events":"https://pith.science/api/pith-number/B4EX4JW6AKNOJOCILNW3AIET2U/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U/action/storage_attestation","attest_author":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U/action/author_attestation","sign_citation":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U/action/citation_signature","submit_replication":"https://pith.science/pith/B4EX4JW6AKNOJOCILNW3AIET2U/action/replication_record"}},"created_at":"2026-07-05T10:16:45.943056+00:00","updated_at":"2026-07-05T10:16:45.943056+00:00"}