{"as_of":"2026-08-19T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdda7a2140514fdb27050bdeb6b0b26397effb4da4b88ccead3028ebe52bb80d","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:30:47.643204Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24302/citation-record","integrity":"/paper/2605.24302/integrity","json":"/paper/2605.24302/citation-record.json","paper":"/paper/2605.24302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.066454Z","title":"Video mamba suite: State space model as a versatile alternative for video understanding, 2024","venue":null,"work_id":"b7ceffc6-bf9c-43f2-9e59-6ebd964f9d2e","year":2024},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:ea47ce2d6ddae6ac92d2d48f8a01a91685f3ff2a2c86ece9820d6ef957365c65","observation_id":"3820128b-af82-4a91-ab75-fcfd589bdcf7","resolution":{"observed_at":"2026-07-08T22:55:41.067679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.068234Z","title":null,"venue":null,"work_id":"4f85ed09-5c04-4486-ab73-79c4ad5dfa4f","year":2024},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:0a60991d409d5b8a698b0dd7240bbf2b50f7034ae974827b269ada9294db0baa","observation_id":"6c58db89-72a4-4458-92a9-be26e8248bbe","resolution":{"observed_at":"2026-07-08T22:55:41.070125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.070738Z","title":"Gigahands: A massive annotated dataset of bimanual hand activities, 2025","venue":null,"work_id":"51f2db23-7b75-41e8-bc5c-2f0b40d46d15","year":2025},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:52dacb4f46ac6785bf4f94fed5ebf5c33286e950011cfe9e93a95f881c590b67","observation_id":"dac8d7ac-b43a-485b-a216-f7a2a4dfcd8a","resolution":{"observed_at":"2026-07-08T22:55:41.071998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.072561Z","title":"The ”something something” video database for learning and evaluating visual common sense,","venue":null,"work_id":"5a8d216d-9fca-4079-bf26-185fc062c164","year":null},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:f042523b9989a5276763566edde9b5a26001c1ee09890910e750643d26a379c6","observation_id":"ad02f11e-00a3-40c3-8a8c-5aa44616ac2e","resolution":{"observed_at":"2026-07-08T22:55:41.073993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.061062Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces, 2023","venue":null,"work_id":"f18a5138-da31-48f9-a078-1c81787ae56d","year":2023},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:8089882db6d0548353b84900d5553a67b7281c85419b107e0d1c51729441c9ec","observation_id":"0c52213a-4fa5-4310-b6c8-25c28f9146da","resolution":{"observed_at":"2026-07-08T22:55:41.062339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.062935Z","title":"H2o: Two hands manipulating objects for first person interaction recognition","venue":null,"work_id":"090d0533-c6f5-4547-9ae1-b931f3b5693c","year":2021},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:bbfe8c000f2449ee28f5d481c8d7d6d0809b9e0c40ae9e52f722eda22aadf1a8","observation_id":"a1f1ead7-f9a0-4faa-832a-3719238eb5a5","resolution":{"observed_at":"2026-07-08T22:55:41.064102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.064662Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":"a89c697a-b899-4d37-ae20-50d380c20dfd","year":2024},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:163c9de62363a6f564257cd74d25c3d506a0c33e9b8b78389dbfb2c8d8409f82","observation_id":"cc3b3d89-1488-4e08-9fd5-68546ffaac27","resolution":{"observed_at":"2026-07-08T22:55:41.065872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.074585Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"998f14c0-aaee-406f-a34d-981bdd7d7114","year":2023},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:9871afb1b1fdb1df61198e1f4e17762a15fd42c083aebd744b49a1ad85e19614","observation_id":"9ef56a6e-9c70-4e40-80e2-166ad32da6c5","resolution":{"observed_at":"2026-07-08T22:55:41.075769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.076322Z","title":"Actionmamba: Action spatial-temporal aggregation network based on mamba and gcn for skeleton-based action recognition.Electronics, 14 (18):3610, 2025","venue":null,"work_id":"5926b0c4-2af6-476e-b391-5c44a17ead37","year":2025},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:383e0c7edae2ea4d6d7271f11b066b525ae0ba905b016c9545f20dd0566c56ca","observation_id":"4949dae5-dc5d-486f-8065-1d741caacfd0","resolution":{"observed_at":"2026-07-08T22:55:41.077721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.056738Z","title":"Oakink2: A dataset of bimanual hands-object manipulation in complex task completion, 2024","venue":null,"work_id":"4eed1662-1d5f-4068-8258-aa704566d0c8","year":2024},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:11e2df89cc91989de838a933bbb7508de5c4f98d2d746a7bc2b88e66a26a7447","observation_id":"549ab09b-7168-4154-9387-efb43551ef67","resolution":{"observed_at":"2026-07-08T22:55:41.058199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:41.058806Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model, 2024","venue":null,"work_id":"0019de01-f347-4dc1-bc9a-84e592e4c070","year":2024},"citing_paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T14:30:47.643204Z"},"links":{"citing_paper":"/paper/2605.24302"},"observation_digest":"sha256:14bc03cde6c637fb71ec9881adf741abd289d0afb02a8ec596203b81a34f3b80","observation_id":"6e25f894-d5a5-4a40-a42e-cec55d7a796e","resolution":{"observed_at":"2026-07-08T22:55:41.060451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24302","last_updated":"2026-05-26T22:04:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:26:52.548105Z","submitted_at":"2026-05-23T00:13:27Z","title":"Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2605.24302."}