{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GRBKK4WPZJFLDYZBY7Y6VFC2E5","short_pith_number":"pith:GRBKK4WP","schema_version":"1.0","canonical_sha256":"3442a572cfca4ab1e321c7f1ea945a27614ce24d014b45c3fb52442a0c6719ff","source":{"kind":"arxiv","id":"2503.18942","version":2},"attestation_state":"computed","paper":{"title":"Video-T1: Test-Time Scaling for Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Fangfu Liu, Hanyang Wang, Kaiyan Zhang, Xiaohang Zhan, Yimo Cai, Yueqi Duan","submitted_at":"2025-03-24T17:59:04Z","abstract_excerpt":"With the scale capability of increasing training data, model size, and computational cost, video generation has achieved impressive results in digital creation, enabling users to express creativity across various domains. Recently, researchers in Large Language Models (LLMs) have expanded the scaling to test-time, which can significantly improve LLM performance by using more inference-time computation. Instead of scaling up video foundation models through expensive training costs, we explore the power of Test-Time Scaling (TTS) in video generation, aiming to answer the question: if a video gen"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.18942","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-03-24T17:59:04Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"c7630658ad9e8e3e8b701b128205c3acb94e252d3618e613f72fa311c4ede3cb","abstract_canon_sha256":"8255270ea5be8f90c5cea62896c2847aa371edc15c9f17fc969ca5fffd24fb49"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:42:16.033509Z","signature_b64":"9Z7O44H1/+w55XFNz2Kd4GuJUP8H5JRa2mmnlNPBMiQRUFSaLB+tbqiNAhc0nDJDP3gTFZlAKM+Wg+umRIFvCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3442a572cfca4ab1e321c7f1ea945a27614ce24d014b45c3fb52442a0c6719ff","last_reissued_at":"2026-07-05T10:42:16.033000Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:42:16.033000Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Video-T1: Test-Time Scaling for Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Fangfu Liu, Hanyang Wang, Kaiyan Zhang, Xiaohang Zhan, Yimo Cai, Yueqi Duan","submitted_at":"2025-03-24T17:59:04Z","abstract_excerpt":"With the scale capability of increasing training data, model size, and computational cost, video generation has achieved impressive results in digital creation, enabling users to express creativity across various domains. Recently, researchers in Large Language Models (LLMs) have expanded the scaling to test-time, which can significantly improve LLM performance by using more inference-time computation. Instead of scaling up video foundation models through expensive training costs, we explore the power of Test-Time Scaling (TTS) in video generation, aiming to answer the question: if a video gen"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.18942","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.18942/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.18942","created_at":"2026-07-05T10:42:16.033059+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.18942v2","created_at":"2026-07-05T10:42:16.033059+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.18942","created_at":"2026-07-05T10:42:16.033059+00:00"},{"alias_kind":"pith_short_12","alias_value":"GRBKK4WPZJFL","created_at":"2026-07-05T10:42:16.033059+00:00"},{"alias_kind":"pith_short_16","alias_value":"GRBKK4WPZJFLDYZB","created_at":"2026-07-05T10:42:16.033059+00:00"},{"alias_kind":"pith_short_8","alias_value":"GRBKK4WP","created_at":"2026-07-05T10:42:16.033059+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20310","citing_title":"Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20707","citing_title":"GEOPHYS: The Geometry of Physical Plausibility","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08231","citing_title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18233","citing_title":"Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15239","citing_title":"TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5","json":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5.json","graph_json":"https://pith.science/api/pith-number/GRBKK4WPZJFLDYZBY7Y6VFC2E5/graph.json","events_json":"https://pith.science/api/pith-number/GRBKK4WPZJFLDYZBY7Y6VFC2E5/events.json","paper":"https://pith.science/paper/GRBKK4WP"},"agent_actions":{"view_html":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5","download_json":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5.json","view_paper":"https://pith.science/paper/GRBKK4WP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.18942&json=true","fetch_graph":"https://pith.science/api/pith-number/GRBKK4WPZJFLDYZBY7Y6VFC2E5/graph.json","fetch_events":"https://pith.science/api/pith-number/GRBKK4WPZJFLDYZBY7Y6VFC2E5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5/action/storage_attestation","attest_author":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5/action/author_attestation","sign_citation":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5/action/citation_signature","submit_replication":"https://pith.science/pith/GRBKK4WPZJFLDYZBY7Y6VFC2E5/action/replication_record"}},"created_at":"2026-07-05T10:42:16.033059+00:00","updated_at":"2026-07-05T10:42:16.033059+00:00"}