{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:XY3EKU7YKYLJ7K77T6IYUWN6DJ","short_pith_number":"pith:XY3EKU7Y","schema_version":"1.0","canonical_sha256":"be364553f856169fabff9f918a59be1a5a10ec7b047c71952052132aea13b7d9","source":{"kind":"arxiv","id":"2506.02382","version":1},"attestation_state":"computed","paper":{"title":"Multi-level and Multi-modal Action Anticipation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Ghassan AlRegib, Ghazal Kaviani, Mohit Prabhushankar, Seulgi Kim","submitted_at":"2025-06-03T02:39:33Z","abstract_excerpt":"Action anticipation, the task of predicting future actions from partially observed videos, is crucial for advancing intelligent systems. Unlike action recognition, which operates on fully observed videos, action anticipation must handle incomplete information. Hence, it requires temporal reasoning, and inherent uncertainty handling. While recent advances have been made, traditional methods often focus solely on visual modalities, neglecting the potential of integrating multiple sources of information. Drawing inspiration from human behavior, we introduce \\textit{Multi-level and Multi-modal Act"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.02382","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-03T02:39:33Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"d087f3cdfc9e019b589189d997c0794fa3d52d729e9c1df369e7176516953719","abstract_canon_sha256":"ce4a0703055ac439c733d42b4d61442c72a8631e58fa9816eff15608006b5535"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:14:37.861634Z","signature_b64":"IU6KrLoTAOB+5XRS9LOvn0EcvpmO0U5C5LEmlyqmUq0lIFPsHxzmWhLS52qEqz3JW739eqjStz2sj1/gLX7dDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"be364553f856169fabff9f918a59be1a5a10ec7b047c71952052132aea13b7d9","last_reissued_at":"2026-07-05T11:14:37.861163Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:14:37.861163Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Multi-level and Multi-modal Action Anticipation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Ghassan AlRegib, Ghazal Kaviani, Mohit Prabhushankar, Seulgi Kim","submitted_at":"2025-06-03T02:39:33Z","abstract_excerpt":"Action anticipation, the task of predicting future actions from partially observed videos, is crucial for advancing intelligent systems. Unlike action recognition, which operates on fully observed videos, action anticipation must handle incomplete information. Hence, it requires temporal reasoning, and inherent uncertainty handling. While recent advances have been made, traditional methods often focus solely on visual modalities, neglecting the potential of integrating multiple sources of information. Drawing inspiration from human behavior, we introduce \\textit{Multi-level and Multi-modal Act"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.02382","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.02382/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.02382","created_at":"2026-07-05T11:14:37.861218+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.02382v1","created_at":"2026-07-05T11:14:37.861218+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.02382","created_at":"2026-07-05T11:14:37.861218+00:00"},{"alias_kind":"pith_short_12","alias_value":"XY3EKU7YKYLJ","created_at":"2026-07-05T11:14:37.861218+00:00"},{"alias_kind":"pith_short_16","alias_value":"XY3EKU7YKYLJ7K77","created_at":"2026-07-05T11:14:37.861218+00:00"},{"alias_kind":"pith_short_8","alias_value":"XY3EKU7Y","created_at":"2026-07-05T11:14:37.861218+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.16264","citing_title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ","json":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ.json","graph_json":"https://pith.science/api/pith-number/XY3EKU7YKYLJ7K77T6IYUWN6DJ/graph.json","events_json":"https://pith.science/api/pith-number/XY3EKU7YKYLJ7K77T6IYUWN6DJ/events.json","paper":"https://pith.science/paper/XY3EKU7Y"},"agent_actions":{"view_html":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ","download_json":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ.json","view_paper":"https://pith.science/paper/XY3EKU7Y","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.02382&json=true","fetch_graph":"https://pith.science/api/pith-number/XY3EKU7YKYLJ7K77T6IYUWN6DJ/graph.json","fetch_events":"https://pith.science/api/pith-number/XY3EKU7YKYLJ7K77T6IYUWN6DJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ/action/storage_attestation","attest_author":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ/action/author_attestation","sign_citation":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ/action/citation_signature","submit_replication":"https://pith.science/pith/XY3EKU7YKYLJ7K77T6IYUWN6DJ/action/replication_record"}},"created_at":"2026-07-05T11:14:37.861218+00:00","updated_at":"2026-07-05T11:14:37.861218+00:00"}