{"as_of":"2026-08-19T09:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49b5bd8363095c369028b1231bb68ca19837e7e262896d32460a4dd2bd80b092","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:33:45.234194Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12576/citation-record","integrity":"/paper/2504.12576/integrity","json":"/paper/2504.12576/citation-record.json","paper":"/paper/2504.12576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.154887Z","title":"Multimae: Multi-modal multi-task masked autoen- coders","venue":null,"work_id":"b0f7afd6-8220-4239-bd8a-13671b42060a","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.920575Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:d11a038cb1dba9691edd87756ca16bfefca2ea2e9a977890bf2ccaa94de4f3aa","observation_id":"8ba16635-3d8c-4301-b6a1-6f41a79519c6","resolution":{"observed_at":"2026-08-16T12:33:46.159804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.140182Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"a3a927f9-ab36-458d-8452-7f3b4d0e5801","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.925773Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:1c048d1223d133444ef2d68f6d17a1ad9adc1751ce300c7f859392a199591b47","observation_id":"5703e613-8c86-4795-86d5-1de470fba762","resolution":{"observed_at":"2026-08-16T12:33:46.144879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-16T18:46:40.012139Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-16T12:33:44.930487Z","title":"Is space-time attention all you need for video understanding? arXiv preprint arXiv:2102.05095, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.930487Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:f4d9846418123bfcf9348f5769b56a7249f9f4c94081fd578e7b5c062526cddd","observation_id":"df0011cb-5772-4953-90df-ea39ecaf7b04","resolution":{"observed_at":"2026-08-16T12:33:44.930487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-16T12:33:44.935504Z","title":"Deepseek llm: Scaling open- source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.935504Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:84f9d249706c029674fdfe4682c05f2e14fc2cd85d6b93d8e7fa2c8812cea074","observation_id":"a40b3fa2-2778-4886-8096-0e6779e508ee","resolution":{"observed_at":"2026-08-16T12:33:44.935504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:44.940844Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.940844Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5c1a1d685a3ebdaae39aff60e8ece9b8c47067744802c02ae8d78db213b754c3","observation_id":"9860ca14-a597-4263-b046-560ef9db0abc","resolution":{"observed_at":"2026-08-16T12:33:44.940844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:44.946536Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.946536Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5e9a878aecdf2eb8684c5fe574c3dc99bd8b3f46ad5ac1e81e2690d5311be76e","observation_id":"aa93e432-08d9-44cd-b267-138a72124aeb","resolution":{"observed_at":"2026-08-16T12:33:44.946536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.105423Z","title":"Weakly misalignment-free adaptive feature alignment for uavs- based multimodal object detection","venue":null,"work_id":"df2832fb-9ccf-4144-b7bb-89d7a2f4ba91","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.951657Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2f33ab5a8bb0437bd46cc7984c4369dd6100ae1f5f368fe5a9306ddea87716f1","observation_id":"c08d217c-1bb1-4b4a-8664-9067cb276728","resolution":{"observed_at":"2026-08-16T12:33:46.110267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.088525Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":"3495a6c0-44ee-471a-9fc3-edb68b3c0677","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.956835Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:ee37c87d7349512f752654b8448615ef7912fea8b8f47ce99a9124dc1d70228e","observation_id":"dfc6f7f1-7290-4ce9-ac27-f489d5702f41","resolution":{"observed_at":"2026-08-16T12:33:46.093955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.072462Z","title":"Segment any event streams via 11 weighted adaptation of pivotal tokens","venue":null,"work_id":"3737f023-fbb7-4d38-8ace-1f67f36981a9","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.961205Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:0c6deeb0a4f0e0f96e31f3a2cdf43c870b22eaca616b5197911f12358d05d1fb","observation_id":"2c7e24f8-b6e3-4255-b13a-092e665e96e1","resolution":{"observed_at":"2026-08-16T12:33:46.077155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.056499Z","title":"Unihcp: A unified model for human-centric perceptions","venue":null,"work_id":"c3310de3-8037-4328-aa01-7055b64a8193","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.965721Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:8bd65d3c09bc96ce91dc598aacfd10a3ffab631d737189a4efb23a861ab407fd","observation_id":"3439abeb-f364-49b7-b0f9-4d799dd7798b","resolution":{"observed_at":"2026-08-16T12:33:46.061113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.041189Z","title":"Satmae: Pre-training transformers for tem- poral and multi-spectral satellite imagery","venue":null,"work_id":"44d842b0-3912-4586-88e2-369d87f972f3","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.970391Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:8686801d247b64fbd5ba298cba92cdc401ff33a3aeb6d88aabff5436b67618e4","observation_id":"38d2fb5d-d24e-432b-b290-d20ae97bc3c3","resolution":{"observed_at":"2026-08-16T12:33:46.046607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.026294Z","title":"Deepseekmoe: Towards ultimate expert spe- cialization in mixture-of-experts language models","venue":null,"work_id":"b6ea5e71-d00e-491e-9f2e-cf63f01550c6","year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.974774Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:383abdf3842c14828f6136e2afbe65f565db564b706fa63c52ea720d04a8118b","observation_id":"98ac94c9-fdf6-4ef3-8dc5-d253015a5fa4","resolution":{"observed_at":"2026-08-16T12:33:46.030964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:46.010817Z","title":"Sfod: Spiking fusion object detector","venue":null,"work_id":"31d95d8c-6f69-4826-b3e7-574db3359a5f","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.980632Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:e3ad4a0122977516cb3c18e87c67c1b2d3ca9950acaa528b72cde23f8a86720a","observation_id":"f59cbf1d-53eb-4070-8f65-f78cd35eb765","resolution":{"observed_at":"2026-08-16T12:33:46.015958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.995616Z","title":"Hypergraph-based multi-view action recognition using event cameras","venue":null,"work_id":"20891e98-2e79-475d-bd64-af256dc532f0","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.985177Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4212292144783451ab9b0816f8b946825f9967b43eec24887ca48a6a29c1ea12","observation_id":"9980f297-1682-430c-8ef0-1241ade1e83f","resolution":{"observed_at":"2026-08-16T12:33:46.000459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14204","last_updated":"2022-10-21T04:26:27Z","snapshot_observed_at":"2026-08-17T01:39:08.213999Z","submitted_at":"2022-05-27T19:09:42Z","title":"Multimodal Masked Autoencoders Learn Transferable Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14204","snapshot_observed_at":"2026-08-16T12:33:44.989651Z","title":"Multimodal masked autoen- coders learn transferable representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.989651Z"},"links":{"cited_paper":"/paper/2205.14204","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:20cc9aee83eeade75cb77e94a6fdf4291efeff525310ddb027c0f2098ecd65a9","observation_id":"de460341-6127-4e57-8104-119f7d72db4d","resolution":{"observed_at":"2026-08-16T12:33:44.989651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:33:44.995396Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:44.995396Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:9e26f63f5cd4fe659483171947b400a7a5b95135d62487421fd487c618251e33","observation_id":"fe194490-520d-45cd-81c3-7fae7ea3d348","resolution":{"observed_at":"2026-08-16T12:33:44.995396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T12:33:45.000275Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.000275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:60b5d1b2a1a98bbcbf613704ca1bfdb965e88f8607f9057e5a665ebdfb1451d6","observation_id":"60b8eedb-36d3-441c-97e2-7c3a88c27f93","resolution":{"observed_at":"2026-08-16T12:33:45.000275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.006252Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.006252Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:7eb5aec2b6f41527a3fd934a4ef3838e937adca1d761368e88594b7f125cbb2e","observation_id":"4e0369dd-4a64-4df6-b92c-11afd59e42b5","resolution":{"observed_at":"2026-08-16T12:33:45.006252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.971481Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"71e69ace-434f-4618-aca8-f5a61bbff58d","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.011021Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:960e1e48c80be6bad853f777d0f1c5af08e2f9292129d2d8ea502f6bc1bde9ce","observation_id":"8bd98e9c-45d6-4423-a31f-055b5ce28c91","resolution":{"observed_at":"2026-08-16T12:33:45.976142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00416","last_updated":"2024-03-01T10:02:25Z","snapshot_observed_at":"2026-08-16T14:13:48.988445Z","submitted_at":"2024-03-01T10:02:25Z","title":"Data-efficient Event Camera Pre-training via Disentangled Masked Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00416","snapshot_observed_at":"2026-08-16T12:33:45.016104Z","title":"Data-efficient event cam- era pre-training via disentangled masked modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.016104Z"},"links":{"cited_paper":"/paper/2403.00416","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:f03cd388840ca23e30585f891fc33897a0001fc4fe2d18f3587d95a989f03af6","observation_id":"034413c5-16c7-4253-b51d-d1856d61227a","resolution":{"observed_at":"2026-08-16T12:33:45.016104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.956616Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":"d0efcf36-9bed-4d3d-8914-bcc10d2fa5b9","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.021864Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:4976166dd3c09c6c12f3b0e68733857aa4b4795cd7688267b3170cbf7626df31","observation_id":"ed5fa96b-ccab-45d1-8890-cdbb3cf69b19","resolution":{"observed_at":"2026-08-16T12:33:45.961258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.026355Z","title":"Spiking-yolo: spiking neural network for energy- efficient object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.026355Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:770cbb15b2cb082923d886ff05baa88edf6883baee568c9506c14cc908db8ba6","observation_id":"fefa5436-bb6e-4ac9-a0fb-110eb4d3a2f5","resolution":{"observed_at":"2026-08-16T12:33:45.026355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.030964Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.030964Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:b87d27832acca772819c77facfa5f49ea3a8f5b2c43950cd7c325d47743f2f45","observation_id":"800ecb3d-ae9e-4fe9-a87e-f5854ef98554","resolution":{"observed_at":"2026-08-16T12:33:45.030964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.035526Z","title":"Masked event modeling: Self-supervised pretraining for event cameras","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.035526Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:f8685d1f36b5d80dcb8834436b140ba5fc55ba88a79a78ba82e9184fb3bab08a","observation_id":"c2ff80af-8f69-4d7e-bc4b-cbc8b470212a","resolution":{"observed_at":"2026-08-16T12:33:45.035526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.913632Z","title":"Openess: Event-based semantic scene understanding with open vocabularies","venue":null,"work_id":"489b93b3-a618-49e8-b17b-543a810022ea","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.040195Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:6c23e900fed79980f2e8aca33000abb4d735c49380cac45cfa4afb8882e0a3ed","observation_id":"de3313fb-2b40-487a-a9d7-94727cda921c","resolution":{"observed_at":"2026-08-16T12:33:45.918387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.044826Z","title":"Mulfs-cap: Multimodal fusion- supervised cross-modality alignment perception for unreg- istered infrared-visible image fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.044826Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:6353d3b000b76e2df0f6c7f6c189ed85b0b71ac09ce5fd86f3c5335617ae2078","observation_id":"bd9ab563-4775-4dfa-ba6b-41e4b9ad8aab","resolution":{"observed_at":"2026-08-16T12:33:45.044826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.888899Z","title":"Coupled mamba: Enhanced multimodal fusion with coupled state space model","venue":null,"work_id":"a7fb0671-9240-41dc-aff0-da13626c85d9","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.049239Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a9e9b84e55fee270f965326fcd04947b5848c0243442246fc3ed2e334cb4da31","observation_id":"e3869773-b7c9-4d8a-987f-c2c7e5b13175","resolution":{"observed_at":"2026-08-16T12:33:45.893764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.874468Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"99721417-5b07-4a19-8978-a97840876257","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.054058Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:ddadb2492dc6248afec06da0ee737c27bb6e3e7f1ec051f8b06279e497076e85","observation_id":"97e04996-459f-4629-879e-6143eabe9f48","resolution":{"observed_at":"2026-08-16T12:33:45.878991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-16T12:33:45.058883Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.058883Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:373042b35c83c78be7c0a383c013732acce658dd2d5fbf6b4fd6241de8dad593","observation_id":"55f2a1b4-1763-4618-aab0-8d7753b2d2f9","resolution":{"observed_at":"2026-08-16T12:33:45.058883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.063794Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.063794Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:aa2f150f3b073faf80194fe33a2d76893f18908dad1cc428caf6590a8e98a1b0","observation_id":"0309dcdf-261d-4b8a-b9b7-223f75749363","resolution":{"observed_at":"2026-08-16T12:33:45.063794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.849683Z","title":"Pixmim: Rethinking pixel reconstruction in masked image modeling","venue":null,"work_id":"1848d67f-8f2b-4000-9682-934255975755","year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.068364Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:fdbd521aee6b6cac0663fdb4e2fb1f063b2a0bcd9e8122806c16e736568f7ee1","observation_id":"f68ca61a-21d8-465b-9239-dd19f5b72050","resolution":{"observed_at":"2026-08-16T12:33:45.854175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.835652Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"a06e5a03-d528-432f-bb7d-c3b6096c7fcc","year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.073164Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:97aaf65c544b754ee3c49551b795666d60608246cecddb30aa15fc55d455ab56","observation_id":"02ce43ba-edb4-4727-be67-8050ee285cda","resolution":{"observed_at":"2026-08-16T12:33:45.840121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.819831Z","title":"Integer-valued training and spike-driven inference spiking neural network for high-performance and energy-efficient object detection","venue":null,"work_id":"684eceb9-b2cb-4e8a-b4fb-7b975d196cfa","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.077761Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:192da6644b2b05f404d87e0a7f0456b6ffaa03e49760ed12e0dcf019fc0d501e","observation_id":"cfa01b67-b41b-4160-90f4-b4e40bbcf0a2","resolution":{"observed_at":"2026-08-16T12:33:45.824766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.804861Z","title":"Event-based moving object 12 detection and tracking","venue":null,"work_id":"986b8cbc-0440-4df7-a6d7-fe4be60f4ad7","year":2018},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.082367Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:756b6c192491d1deb6c8bbeb770b81ea0c5eb2c0c9351da7144650eb7724ca50","observation_id":"c3370488-1ea8-492f-9a40-ae424cf4d65b","resolution":{"observed_at":"2026-08-16T12:33:45.809465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.789215Z","title":"Rethinking transformers pre-training for multi- spectral satellite imagery","venue":null,"work_id":"feb13ea1-12da-42e1-a98c-3a54fcfcdc76","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.087166Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a0b5e421862aeb3092c231a37f19dfe387b5dc811a6bc002648ac96b39efe5a6","observation_id":"e3dc42bd-b708-467e-86eb-359e73d63f8a","resolution":{"observed_at":"2026-08-16T12:33:45.794835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.092015Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.092015Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c96eaf7a010a589694eacb92545a2b320678cafd4390c1c2f0f1a85d809479ae","observation_id":"5b8fe7b3-96cb-40c8-9a09-78a03e83ce5e","resolution":{"observed_at":"2026-08-16T12:33:45.092015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.765317Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":"67930d22-5e67-4e59-a13d-4a8c545a3619","year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.097788Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:95885ae69df2d14374fd236a4b1ac820eb0657cc4887e487b6657f63df6a8e0a","observation_id":"20971ba1-d35b-46ab-99ed-729cfdd53ed2","resolution":{"observed_at":"2026-08-16T12:33:45.770086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-16T16:39:31.250386Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-16T12:33:45.102760Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.102760Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:67dd547be855490040aac5389a4f48fd9155d5f21b1094d7bd834f789f4f1678","observation_id":"f8113807-ab7e-474d-9622-52d29421a468","resolution":{"observed_at":"2026-08-16T12:33:45.102760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.107543Z","title":"Detectors: Detecting objects with recursive feature pyramid and switch- able atrous convolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.107543Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:71a2c2488426fa0de52be0bc3401e0c93187600fec2b0d0d610d7838546c877e","observation_id":"222c146c-c03c-48cb-a699-0c35812d253f","resolution":{"observed_at":"2026-08-16T12:33:45.107543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.112156Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.112156Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:e5bb30d2a441b5341b77b8d3934fa8ca35ef1f8b7f721a5d732cfbc10df9cf58","observation_id":"0105fd7e-2943-4883-9f02-d8cbedb24a00","resolution":{"observed_at":"2026-08-16T12:33:45.112156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.116617Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.116617Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2fb3e8b0019700b5a85d4c308547f08023f59a2241e096001d6e037c16da6af4","observation_id":"65c96e97-f43b-4d3d-bd3c-f7c288d743cb","resolution":{"observed_at":"2026-08-16T12:33:45.116617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.121084Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.121084Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:277fe82712747508999cc7ee489f049fdf551c4a4419f9c2dde04f756395d79c","observation_id":"1ed4d3bd-0aa9-4d44-b1f5-6f872cb9e01f","resolution":{"observed_at":"2026-08-16T12:33:45.121084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.713138Z","title":"Scale-mae: A scale-aware masked autoencoder for multiscale geospatial representation learning","venue":null,"work_id":"59d1895b-0af5-48cc-94b2-2e584671fc8a","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.125427Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:c97e6dd987846efffda9b0b5f843c6dabbdb9462c5dfc9321da43fd0ed04c89d","observation_id":"3674552d-2517-4313-9bdd-5f19b8022cee","resolution":{"observed_at":"2026-08-16T12:33:45.717949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11010","last_updated":"2024-01-08T13:27:47Z","snapshot_observed_at":"2026-08-16T16:14:45.359883Z","submitted_at":"2022-11-20T16:01:31Z","title":"Revisiting Color-Event based Tracking: A Unified Network, Dataset, and Metric","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11010","snapshot_observed_at":"2026-08-16T12:33:45.130092Z","title":"Revisiting color-event based tracking: A unified network, dataset, and metric","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.130092Z"},"links":{"cited_paper":"/paper/2211.11010","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:cfb4a75c64b3184e8e98cc5f6a08c818c888bc3c5fff33380b8b1c44eb62c928","observation_id":"af078688-5acc-4713-a44c-21535e3343a3","resolution":{"observed_at":"2026-08-16T12:33:45.130092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.698241Z","title":"Humanbench: Towards general human- centric perception with projector assisted pretraining","venue":null,"work_id":"aa17b35b-6c63-479b-8153-f841ef6bd363","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.135573Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:fee26d8bd20a9937aa52099b4aa95470d676c0ab331678be2368f9ce98501b51","observation_id":"e0f732fa-39b3-469c-96f1-09333daf40be","resolution":{"observed_at":"2026-08-16T12:33:45.703106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-16T17:12:17.691398Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-16T12:33:45.140311Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.140311Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a86c635faf42ca029bdc60d8ef341cc7f2f34216c23fe2d1b30db5457e6a0c90","observation_id":"4ce8beff-01ba-4ca3-abd0-03ee8f555aa6","resolution":{"observed_at":"2026-08-16T12:33:45.140311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T12:33:45.145257Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.145257Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:d18257bd259633e75f0661fdd4b1147e928c097d1ad459f967e36f31c8a19856","observation_id":"a94de740-76e3-47cc-bd6c-d0cdec7f82f6","resolution":{"observed_at":"2026-08-16T12:33:45.145257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:33:45.149913Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.149913Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:e65f417aa71d96df786ebea81403c3e369cbaa93c283c4c3719836531eb7c994","observation_id":"0b3114b7-928e-4e90-af68-6b680b606807","resolution":{"observed_at":"2026-08-16T12:33:45.149913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.683993Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"69469fb0-d171-46e6-a2b5-6e4d8491fd54","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.154973Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:40fd9fc114037221de6f6513d37cdcee21a55ae49e777bcf5148d8be3459ebb8","observation_id":"114a39bf-a593-480c-8fb7-a6c1635fbd4d","resolution":{"observed_at":"2026-08-16T12:33:45.688661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.668445Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":"fe16c4d2-4342-48d9-88b8-1400560b0ca7","year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.159467Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:7ebe5e42aa96bfc111fbef3da379e422ec93879339829b2534f515b46c3b191d","observation_id":"2d48d814-d7c5-4c57-ba50-76c3c3e1a92b","resolution":{"observed_at":"2026-08-16T12:33:45.673472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.651628Z","title":"Vi- sevent: Reliable object tracking via collaboration of frame and event flows","venue":null,"work_id":"f8cf454b-b4d9-4135-ba75-345d13308815","year":1997},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.164092Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a9dc35076ee1b7abfefbd5a37da42ec97659096db60149cd5bd8ae8c4e8fec22","observation_id":"659f7318-309d-43d2-bc62-70506a10c14d","resolution":{"observed_at":"2026-08-16T12:33:45.656566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06647","last_updated":"2024-12-09T16:40:34Z","snapshot_observed_at":"2026-08-15T03:22:00.059004Z","submitted_at":"2024-12-09T16:40:34Z","title":"Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06647","snapshot_observed_at":"2026-08-16T12:33:45.168675Z","title":"Object detection using event camera: A moe heat conduction based detector and a new benchmark dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.168675Z"},"links":{"cited_paper":"/paper/2412.06647","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:17dac7cf520c7e1401b35986433d946cbc1714b3d9c84eebab094951c24fd295","observation_id":"6cabab66-b653-495d-b316-1007dbcc9457","resolution":{"observed_at":"2026-08-16T12:33:45.168675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17926","last_updated":"2024-04-27T14:29:53Z","snapshot_observed_at":"2026-08-18T07:52:03.067245Z","submitted_at":"2024-04-27T14:29:53Z","title":"Pre-training on High Definition X-ray Images: An Experimental Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17926","snapshot_observed_at":"2026-08-16T12:33:45.173911Z","title":"Pre-training on high definition x-ray images: An experimental study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.173911Z"},"links":{"cited_paper":"/paper/2404.17926","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:223672bb7944eebc5c8966ef44ec6ce45a302ae2fdc3606778249d8ce709e76e","observation_id":"d60a012c-cff1-4059-a3cb-6635e5bc8211","resolution":{"observed_at":"2026-08-16T12:33:45.173911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.636567Z","title":"Event stream-based visual object tracking: A high-resolution benchmark dataset and a novel baseline","venue":null,"work_id":"3efafa83-75fa-4b5d-8e72-b3ceb70aec5a","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.178551Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:a599a3d14866dd7db2b31f657776b580d374404395225177e123d62fbba419b4","observation_id":"c82d5b01-70e9-4563-b000-c083b4671f72","resolution":{"observed_at":"2026-08-16T12:33:45.641198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.621840Z","title":"Structural information guided multimodal pre-training for vehicle-centric percep- tion","venue":null,"work_id":"e1c3bfb0-d981-4aab-ae0d-f9fd8fc2d642","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.183525Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:bb1763be9f1dc2abf0760aa96625cb7b5a4d55733fcb5085551cb237df55640b","observation_id":"5d19998c-fecb-40ec-a7f8-bb8dfc73f81b","resolution":{"observed_at":"2026-08-16T12:33:45.626716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.606431Z","title":"Hardvs: Re- visiting human activity recognition with dynamic vision sen- sors","venue":null,"work_id":"f0f60a3c-6c86-4a7f-a20c-e36828eee05c","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.188277Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:00a863673a24f730cda6958406a79e813474a4c202eb9c7270046407dfbe607c","observation_id":"519c5d77-222a-47be-a7be-b6cb6c73b803","resolution":{"observed_at":"2026-08-16T12:33:45.611488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.591210Z","title":"Multipath event-based network for low-power human action recognition","venue":null,"work_id":"1dad88b7-8d6b-4c7d-be24-2aff912c9aae","year":2020},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.192890Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:51f593ebed7bbbcbaa52fd18891aba304ac99d25246bd004fae3defe98b67be8","observation_id":"9f5af015-e868-42e2-9939-4bd60da1cd75","resolution":{"observed_at":"2026-08-16T12:33:45.596237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.197522Z","title":"Event camera data pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.197522Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:dbf2151ea6324c4c1d81826e40d0ce4351cea3d5d2c0b0c2e7036763f30d752c","observation_id":"6619c4a3-f1c4-4597-b17f-458372397f34","resolution":{"observed_at":"2026-08-16T12:33:45.197522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-16T12:33:45.202194Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.202194Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:df35bb6f2e3d7d2a8d24138ec6ca9cdcecba313463054ff1de2daadfd5bfbc7e","observation_id":"015ff7b0-d559-4ef7-998a-84cc6be01d65","resolution":{"observed_at":"2026-08-16T12:33:45.202194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.566865Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object de- tection","venue":null,"work_id":"8a7d73f4-21fa-422b-9e57-83686f0cec79","year":2022},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.207077Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:3006af492290e8aef65da9da836468cc7a45e2ea0bf3017fe7319e7e78ef1c75","observation_id":"f939e99e-2774-471e-8bab-d66d1273ef23","resolution":{"observed_at":"2026-08-16T12:33:45.571713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.211899Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.211899Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:2e699ccf06f1481d76f67bdd0dd4de5416e403b3431d1cfa61a8cf9f6a668559","observation_id":"33f32570-e839-459e-96b9-e2096d899de8","resolution":{"observed_at":"2026-08-16T12:33:45.211899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.543439Z","title":"Image bert pre-training with online tokenizer","venue":null,"work_id":"bdf7eace-adaf-43f0-b52a-ee9251b76ce8","year":2021},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.216184Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:65c0f1211674fe2ccc3523927d4d334086f1d989a3cd7628847ed76cbfd23e03","observation_id":"a1c57396-d39c-4ebe-93e8-8329ad2606f8","resolution":{"observed_at":"2026-08-16T12:33:45.547965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.528756Z","title":"Ex- act: Language-guided conceptual reasoning and uncertainty estimation for event-based action recognition and more","venue":null,"work_id":"059b40b6-c4dc-4e1a-a6c8-ac3d6a218cf3","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.220773Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:ae85a37094f09fd8e89ea38ce61c8d9835bc8f8ef60eb0e2457e36436699b4f1","observation_id":"da8c1892-5d29-40d3-9215-cc601b1c1f3b","resolution":{"observed_at":"2026-08-16T12:33:45.533474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.512134Z","title":"Event-free moving object segmentation from moving ego vehicle","venue":null,"work_id":"bbbf94b7-53b4-4dc9-90b0-13ae6ab21295","year":2024},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.225157Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:21048a9a65b985869ba5c5bd3a797f74d3d22b1a3036fbbbdc4224ca5b13a252","observation_id":"b4b144e9-967a-4cd5-9f00-5ef8ae27502a","resolution":{"observed_at":"2026-08-16T12:33:45.518562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:45.229598Z","title":"Segment everything everywhere all at once","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.229598Z"},"links":{"citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:8d4a0af9830f2b8c40d714055f90017e38938a5236f83a134364e0220d624781","observation_id":"f30c6a45-9e2b-49b5-b6c3-1ba9152998fd","resolution":{"observed_at":"2026-08-16T12:33:45.229598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08386","last_updated":"2024-05-29T08:57:39Z","snapshot_observed_at":"2026-08-18T05:03:25.587175Z","submitted_at":"2023-05-15T06:49:00Z","title":"PLIP: Language-Image Pre-training for Person Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08386","snapshot_observed_at":"2026-08-16T12:33:45.234194Z","title":"Plip: Language-image pre-training for person representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:45.234194Z"},"links":{"cited_paper":"/paper/2305.08386","citing_paper":"/paper/2504.12576"},"observation_digest":"sha256:5f668241d695882dae6b0bd276ff5bcaab405dac30fd1ef234c67612f808c4b3","observation_id":"4967cac0-fc44-4460-be2f-93c159ec9ba6","resolution":{"observed_at":"2026-08-16T12:33:45.234194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12576","last_updated":"2025-04-17T01:49:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T05:03:41.669155Z","submitted_at":"2025-04-17T01:49:46Z","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2504.12576."}