{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c4c72aeb001f0e60728bf5dc16bf63292d80543d54e1ad4d5b74a426830366a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:05.265658Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:29:27.063028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:35:04.650377Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"cited_work":{"arxiv_id":"2506.14356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14356","snapshot_observed_at":"2026-06-30T21:35:04.650377Z","title":"Eva02-at: Egocentric video-language understanding with spatial-temporal ro- tary positional embeddings and symmetric optimization","venue":null,"work_id":"be0cdc8c-e252-4e3f-98e3-b553d3488d58","year":null},"citing_paper":{"arxiv_id":"2605.14742","last_updated":"2026-05-14T12:10:27Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:10:27Z","title":"EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:29:27.063028Z"},"links":{"cited_paper":"/paper/2506.14356","citing_paper":"/paper/2605.14742"},"observation_digest":"sha256:440d41bffb4ae49d421e3745b9155ffb97d3a2f5e444c32c10ca39eb97723d4f","observation_id":"f36432fc-d3bc-424a-92ef-4a6a6846fb18","resolution":{"observed_at":"2026-06-30T21:35:04.652174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14356/citation-record","integrity":"/paper/2506.14356/integrity","json":"/paper/2506.14356/citation-record.json","paper":"/paper/2506.14356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.545059Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"12bdba57-255a-4f08-8f4c-2226dd5ff71f","year":2017},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.431559Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:cc77a07e5b043238c74cb57f529e922802eb13e2089af3e855677d0fc96e1047","observation_id":"3b3039c5-4f63-43b2-96a1-d4c4fc357c19","resolution":{"observed_at":"2026-08-07T00:26:10.550525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.531094Z","title":"Video summarization through reinforcement learning with a 3d spatio- temporal u-net,","venue":null,"work_id":"2cc18413-a434-452e-8b0c-d7a46b69b636","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.542659Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d22a84d9f7485a7cbaecc34f2719d1b1ed76b46d3b61b2c1fa0bf2a726c3921d","observation_id":"3b05827e-9bcb-4504-b918-91617a462caa","resolution":{"observed_at":"2026-08-07T00:26:10.535398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.516992Z","title":"Deep attention network for egocentric action recognition,","venue":null,"work_id":"5ef82d32-7b2d-4d41-9789-e61336fe728c","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.700863Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8a2ac4999f0dd35d273705f7e79eaf3d88b44d6ac3a3193767a6675574a043e9","observation_id":"b2e2b62d-3ff3-42f4-b510-693cd4de7b11","resolution":{"observed_at":"2026-08-07T00:26:10.521628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16669","last_updated":"2023-09-28T17:59:50Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:59:50Z","title":"Training a Large Video Model on a Single Machine in a Day","version":1},"cited_work":{"arxiv_id":"2309.16669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16669","snapshot_observed_at":"2026-08-07T00:26:05.896375Z","title":"Training a Large Video Model on a Single Machine in a Day","venue":"cs.CV","work_id":"8c42d068-7973-4b68-a59f-bce8ede97627","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.818943Z"},"links":{"cited_paper":"/paper/2309.16669","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:7e4b8a7b87ed2350c0a87a055d1c08a6d5d4e29d0d578dac05f91ec632e1b522","observation_id":"416ae5dc-9eea-4ae5-8c37-38a17c72361d","resolution":{"observed_at":"2026-08-07T00:26:05.951232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:25:59.990074Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.990074Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:f8990f93aedcf3bcae236f09713c5848ddcb1a200204ecd45ccffcbfccdf7b7b","observation_id":"c5d6b164-6f58-4f03-a66e-b3565b0bde8d","resolution":{"observed_at":"2026-08-07T00:25:59.990074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T00:26:00.161920Z","title":"InternVideo2: Scaling foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.161920Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:281c054908cf0595cf93ff32839100527bf12c5763f4f696ff8b53dcd1e02669","observation_id":"0c6c2b82-1304-4e98-8301-7975bacc3446","resolution":{"observed_at":"2026-08-07T00:26:00.161920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.503788Z","title":"EgoVLPv2: Egocentric video-language pre-training with fusion in the backbone,","venue":null,"work_id":"49845ecb-79be-4416-9a5e-23f3d6c5736a","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.334603Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:ce887f3c9867beafe81a18e97cafe6daae07ac8c528b03232a52bb5c3bd7b867","observation_id":"a2d5163b-29bd-4182-9040-32cfece62edd","resolution":{"observed_at":"2026-08-07T00:26:10.507959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.491035Z","title":"Egocentric video-language pretraining,","venue":null,"work_id":"17a06723-3003-4dc7-b584-d6d88895eed3","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.477538Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:ee2ccc6b1279f88537f3e6e6eb574cc18dcbf6e9f5736ca301e9d01760844275","observation_id":"82d49f24-f819-402c-81c9-472ae702a1bd","resolution":{"observed_at":"2026-08-07T00:26:10.495279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.476823Z","title":"Improving semantic video retrieval models by training with a relevance-aware online mining strategy,","venue":null,"work_id":"7039cbee-f62b-4ce0-9116-1ed9ab160a9f","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.576434Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:c63da77fac192e527e53d80965e248f3cc66cdbf4e99c48646d08c835a2f68c6","observation_id":"144cc8dd-9c57-48e0-8412-8e9a04012dba","resolution":{"observed_at":"2026-08-07T00:26:10.481056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.463601Z","title":"Learning video representations from large language models,","venue":null,"work_id":"a0bf7269-09ad-4d6f-ba1e-08530cb9e887","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.716989Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:345c0cee56ed183a247c0cebd3c929c43202e460abb576e15e6327c7de39dc18","observation_id":"04357bdc-9f02-452b-ae9e-54018f9be793","resolution":{"observed_at":"2026-08-07T00:26:10.467688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-07T00:26:00.852320Z","title":"Egovideo: Exploring egocentric foundation model and downstream adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.852320Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:589521088b80ddc68f3fc931ad2743f3a3eeb2f19bde7abe34f5e191a02b6945","observation_id":"f9ec9a56-fbec-4170-bf4d-b6170093b1b6","resolution":{"observed_at":"2026-08-07T00:26:00.852320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.448161Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":"31fc437f-07f0-4869-a40d-38fc2391131c","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.017157Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:a512dc3b5202db9f07dfba9411bb75c0d4975e783ad6b15c3baf69086d1782de","observation_id":"93e8b51b-8004-400e-9a20-d4c80012e913","resolution":{"observed_at":"2026-08-07T00:26:10.453114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T00:26:01.224115Z","title":"Laion-400m: Opendatasetofclip-filtered400millionimage-textpairs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.224115Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:4bad383c7afe9a4bdd6d2ceca5157b0abf7e8354d8a341dfbbf752373e1d8cd0","observation_id":"3aa1e723-af16-4d5f-8aa8-4345f828d67c","resolution":{"observed_at":"2026-08-07T00:26:01.224115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.433895Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":"7bf16bb4-4c9a-4db7-ba6d-5abd7719db34","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.393406Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:283d81b3206be8fdff37dff19e4db71bec7266e53edee21f443f5cacd1ce101c","observation_id":"4cda262c-684a-4f56-9402-0d6eabd98073","resolution":{"observed_at":"2026-08-07T00:26:10.437990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:26:01.534507Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.534507Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:ce0e699d6e4ce2288acaaca522f9ed528273ddcefc9531a085ae9f80174e63dd","observation_id":"69ab1970-654d-4c41-a237-ef7ac463104c","resolution":{"observed_at":"2026-08-07T00:26:01.534507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T00:26:01.692337Z","title":"EVA-CLIP: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.692337Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:a5ba8b1da9e3314f7a37e90a3f3213e943cb5d2257680cab6ea335293a4e91ec","observation_id":"7fbc78e4-1606-4303-b25e-ece1889a162a","resolution":{"observed_at":"2026-08-07T00:26:01.692337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T00:26:01.868488Z","title":"CogVideoX: Text- to-video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.868488Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:3dace60233b14486c37c30eee5b5513a153a95265b6e91e02b6c247054f65ba1","observation_id":"7176760f-561d-43fe-bc91-9b9f7c99fb15","resolution":{"observed_at":"2026-08-07T00:26:01.868488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-07T07:27:03.329708Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-08-07T00:26:01.964467Z","title":"EVA-02: A visual representation for neon genesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.964467Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:226eca485b4a4e932207a7afb15bd9c58287427a2a8ab74f0273f804da24f695","observation_id":"0c2c0630-67ea-4f02-96fb-a8e0cd32a142","resolution":{"observed_at":"2026-08-07T00:26:01.964467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.420287Z","title":"Multi- similarity loss with general pair weighting for deep metric learning,","venue":null,"work_id":"6ff34638-46f5-4e00-af32-f257390ddc45","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.137317Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0c916c46c76cf7ffb16559f044b2e9bbc1ccc2f06254cfbde005f65701073243","observation_id":"45c01c0e-2c0c-4446-ae29-20e8d6fed1c2","resolution":{"observed_at":"2026-08-07T00:26:10.424959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.356807Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"1ec8c652-f272-458d-8af8-562fad46fc50","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.208447Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:40ab48be63073616e088470fcc7a0f249b1e403cbb74377f4a73dd860ded2f30","observation_id":"ab8d33a3-8344-4b78-99e6-7feda72268a3","resolution":{"observed_at":"2026-08-07T00:26:10.410562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.001275Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens- 100,","venue":null,"work_id":"53f95643-3b3b-45ae-a439-75e8940fc674","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.280538Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0c945e4377b9a5cf9ea741c6142df9bc9b98ddc7273d0560a04706f12478d0ea","observation_id":"7aed2aee-2f71-4fe6-bcdd-308d381bc970","resolution":{"observed_at":"2026-08-07T00:26:10.218130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.768033Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"2274a564-688c-4883-b492-b31af28cbfde","year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.395824Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:2de1ad1d87eaf705f5b9fa9f011ddf3bdd8c7783dc7632a32972f7ebfee4dd20","observation_id":"7ba327eb-6879-4ede-adc7-5b81d3a058b7","resolution":{"observed_at":"2026-08-07T00:26:09.831272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-07T00:26:02.474819Z","title":"Charades-ego: A large-scale dataset of paired third and first person videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.474819Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:cfdadf3318522a88b770aa4d2c28fa9132c116d59bb93cc89b97d569e644c46c","observation_id":"f8f59c61-0302-4d25-aa0e-c79e170886c6","resolution":{"observed_at":"2026-08-07T00:26:02.474819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:02.579192Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.579192Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:42486bbba8d68a47d0abd034f910f885ad653bd7b3d042f04767c5d672f01dc3","observation_id":"7c7b3501-3185-4670-a377-336c7b19a095","resolution":{"observed_at":"2026-08-07T00:26:02.579192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.608099Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":"56df40cf-199c-4900-a321-65a4edb60fcb","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.688759Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:53808704a4fbea8e6e3b2b9915a80e0e178fe62b7ac6dd6616138f08dc14c5c9","observation_id":"0f86341f-085c-4b6c-9496-678cb767245d","resolution":{"observed_at":"2026-08-07T00:26:09.719279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:02.803661Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.803661Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:1bc000f3969ecfd201086150cbe0fea4e2980458ec69cbf0668eb2cdfcb8987a","observation_id":"8a3e82d7-031b-4fea-b2b7-9e35cac358e4","resolution":{"observed_at":"2026-08-07T00:26:02.803661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.271971Z","title":"VideoMAE V2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":"7d17afe8-1eb0-4a5f-828b-224088d18e5b","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.910107Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:b0921966f13257d9c1f9fdc80387cd665ffb1f0cc5fa690b0283249e6a53f403","observation_id":"df4130a7-8ddd-434b-a195-251c34c4c424","resolution":{"observed_at":"2026-08-07T00:26:09.436074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.029258Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"3c6dc81f-b672-4964-a4d3-3c00466b3103","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.983354Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:84dc13fa4b1ce220e74a7d229c57db8d1d77513e286027561b83901775681aed","observation_id":"47013c40-a70d-4d51-b498-12e7e211c017","resolution":{"observed_at":"2026-08-07T00:26:09.120647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.758606Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":"7a399c8a-9c17-40c8-99cc-3a6fc4e09ba9","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.094336Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:a84495ced0cbc3b207bff4bac122fc6e89d59fb6f90427c8d9566f613a163944","observation_id":"46fab9ae-e11f-4030-a325-dc9b400980ad","resolution":{"observed_at":"2026-08-07T00:26:08.908407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T00:26:03.203928Z","title":"Video-LLaMA: An instruction- tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.203928Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:239645020492be242d730fc9e89de6b1fba5cdf626d068e5bff75f17236420ce","observation_id":"d3b604c5-7e92-45b2-bcb2-12430e34096d","resolution":{"observed_at":"2026-08-07T00:26:03.203928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-07T00:26:03.315947Z","title":"VideoRoPE:Whatmakesforgood video rotary position embedding?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.315947Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d1d8f4f91edaead8ff8f8ca90cc1d2bb659364ceab3d2f01f3a35c71bd1ad253","observation_id":"72d0da19-90bd-49a7-bad9-1dce2fcd7bc2","resolution":{"observed_at":"2026-08-07T00:26:03.315947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.484620Z","title":"Supervised contrastive learn- ing,","venue":null,"work_id":"21d3436c-f07b-4684-88cf-65ac270063de","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.397899Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:40cf112885e0412f4433b376e6510e6c7e25d1441913fd1f89c8a4ede3fbe272","observation_id":"1db5d195-264f-4332-b8ae-69d2eef1df4c","resolution":{"observed_at":"2026-08-07T00:26:08.615395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.191077Z","title":"Parameter-free deep multi-modal clustering with reliable contrastive learning,","venue":null,"work_id":"c0646ee9-410f-476b-a8bd-fef486e9b8ca","year":2025},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.518745Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:7f682183a60ee86eaa0b2088ecfbdd71aef02350791ebe9ac6a61f056621a183","observation_id":"a6dcc2cf-ea91-4430-a219-604ca220f721","resolution":{"observed_at":"2026-08-07T00:26:08.308703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.895695Z","title":"Cross-modal contrastive learning network for few-shot action recognition,","venue":null,"work_id":"06e57213-e346-440a-a000-70ab97390883","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.600867Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:138cc37fa181c4692eccdb2f91cfb2a3734ebbef77540451fd176d7807ecb028","observation_id":"34495b16-3787-4229-aac2-8c1013cfe167","resolution":{"observed_at":"2026-08-07T00:26:08.040114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:26:03.695009Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.695009Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:f9414b6fb286ea33e7a063118b7ff76fda809a71a7ad356ae3866ab5e1d9f6c5","observation_id":"2423d424-3315-4b21-a30c-f5c861e37277","resolution":{"observed_at":"2026-08-07T00:26:03.695009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.776699Z","title":"End-to-end learning of visual representations from uncurated instructional videos,","venue":null,"work_id":"e0783bce-59e4-41ae-ae36-ef7637fcbf13","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.805158Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8ed7bd67841a2965d0005472c377914478c544ed5a4f7d3bb9971d4bab97d842","observation_id":"30bce6e3-7aa2-4791-a3b7-8242b8c22b93","resolution":{"observed_at":"2026-08-07T00:26:07.827552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.674401Z","title":"Facenet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":"b231ae7b-afbe-4f75-ad5d-a1a1e4dd451b","year":2015},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.911202Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:fd00aeaf901717a54c9d61fbdd9cacace7b07639cc2e9439a3c0093924fdacd1","observation_id":"dd7dbc9d-7868-4a71-ae29-fec6e005ca2f","resolution":{"observed_at":"2026-08-07T00:26:07.728889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.563644Z","title":"Circle loss: A unified perspective of pair similarity optimization,","venue":null,"work_id":"df3bf06e-1fe2-4d3e-b80f-7c10d833f68c","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.992358Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:347bc2dd6c8d9c5b6130cebcaa26a931f11351f821180625ce73a6725599f21f","observation_id":"5858fc87-7a64-427c-8795-10f7672704a3","resolution":{"observed_at":"2026-08-07T00:26:07.605657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.437811Z","title":"Relevance-based margin for contrastively-trained video retrieval mod- els,","venue":null,"work_id":"840c8a67-8907-448f-8fac-8dc72681b974","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.100339Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:e37e35711e70dd01b4e0ed9e535ea302ba13126d69e75a72e58924e1932a1001","observation_id":"49ed26cd-60af-4674-93e2-0eb323b8581d","resolution":{"observed_at":"2026-08-07T00:26:07.497252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.277979Z","title":"Masked video distillation: Rethinking masked feature modeling for self-supervised video representation learning,","venue":null,"work_id":"486e391f-8aff-4b0a-bb81-fd0c600ddc8f","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.178813Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:79321f35711425000e63bc47bbd936cbf58e478b9223c9f8774e80bd8862182a","observation_id":"677b1418-3e49-410a-a9de-4e81b4db830a","resolution":{"observed_at":"2026-08-07T00:26:07.350471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.146652Z","title":"Fine-grained action retrieval through multiple parts-of-speech embeddings,","venue":null,"work_id":"79df891b-7f17-4df2-ae27-72fba1d68a1c","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.268357Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:c3a5ece58075a63ad47279c3434319c1de93030e0065c17148c5a0815325a8d8","observation_id":"2f8337f0-1222-4470-8bbf-3b7e10e8222a","resolution":{"observed_at":"2026-08-07T00:26:07.212680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.999967Z","title":"On semantic similarity in video retrieval,","venue":null,"work_id":"72d1b89f-0611-41cb-aeb3-615aaadaf207","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.332494Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:c188d6aedade2021cb08762625b3c69984a7fa1782e7ca5d329903a9712edf88","observation_id":"aa116c9e-61d8-4509-b642-0b598643aea5","resolution":{"observed_at":"2026-08-07T00:26:07.075302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01334","last_updated":"2022-08-03T12:08:50Z","snapshot_observed_at":"2026-07-06T13:27:25.991386Z","submitted_at":"2022-07-04T11:32:48Z","title":"Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2022","version":2},"cited_work":{"arxiv_id":"2207.01334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01334","snapshot_observed_at":"2026-08-07T00:26:05.549051Z","title":"Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2022","venue":"cs.CV","work_id":"676d24ea-6ece-46f8-aa90-d290fe62c337","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.405236Z"},"links":{"cited_paper":"/paper/2207.01334","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8c85f530901ef4c857278b4869c3fb55c9cf0f5396092025d3689d8b3d52d867","observation_id":"431349d9-3713-4553-afbb-2d7961ed415d","resolution":{"observed_at":"2026-08-07T00:26:05.630065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.898694Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":"460fe5d0-dfb6-430e-9cf3-5d3d9c3f529f","year":2011},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.491269Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:df84188d4a7a07e90519648810a17e6a1b0923c4659daee787b9de77225ca1c7","observation_id":"d653bc96-b238-49b9-bc71-1b6c966c223c","resolution":{"observed_at":"2026-08-07T00:26:06.939788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.801439Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition,","venue":null,"work_id":"277ddf55-4c35-4bd1-adaf-3db4a2932ce4","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.577115Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:78e9c5e9e17c13a5a5bf81fac829dc81c90d72a1aa56e4391e8ce3ccf00d4c62","observation_id":"f784b997-ab31-4fbf-b6d6-9a2195580094","resolution":{"observed_at":"2026-08-07T00:26:06.834335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:04.664578Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.664578Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8d6ba1f5ecf5dc6e1d6c2b8535ba230bf4aee6545ea48399edca0c472fb56b94","observation_id":"1b72421b-4411-4f93-bd51-689cb203ecfb","resolution":{"observed_at":"2026-08-07T00:26:04.664578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.685540Z","title":"HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"871a7370-5adf-4849-b1cf-0abfbf93d1cf","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.750789Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:11d861d92d3ea06b7352b99ee829006bfbb1f0c3b39445357eb59b5b2e94ce8a","observation_id":"7a5978af-2eed-4efd-9175-fb775f39d593","resolution":{"observed_at":"2026-08-07T00:26:06.732224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.515756Z","title":"Rethinking spatiotem- poral feature learning: Speed-accuracy trade-offs in video classification,","venue":null,"work_id":"c2d7a185-c15a-4d0a-80e0-4682f68591ab","year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.815632Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:e45628f9ee8815635eb0738a34cf7ada4dad29bc40c3d94775564297876abf59","observation_id":"cc0c3d76-bd7f-44da-b907-3baf74be4d47","resolution":{"observed_at":"2026-08-07T00:26:06.594967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.337807Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"b35dffe5-fc03-442f-9484-6bdc85562a08","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.888141Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d8d776ca7b2b1e72f9595ab018cfeaf7a2a90dc21a6e8bf7bac385d76bb04d20","observation_id":"b475f87a-9c8c-4317-b1b7-9243d14519ca","resolution":{"observed_at":"2026-08-07T00:26:06.422516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.191997Z","title":"Hiervl: Learning hierarchical video-language embeddings,","venue":null,"work_id":"d7615d00-7bd9-4be8-8016-76f50fb16a0c","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.957092Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:aa823cc1a037ce6171ea5f070185bad3d19352fe2eda89f3f953a1801d777866","observation_id":"e9c8fe45-b40d-420a-b7cb-4a383d5660b0","resolution":{"observed_at":"2026-08-07T00:26:06.261608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09462","last_updated":"2024-06-13T03:57:38Z","snapshot_observed_at":"2026-08-05T14:07:56.144519Z","submitted_at":"2024-06-13T03:57:38Z","title":"SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video","version":1},"cited_work":{"arxiv_id":"2406.09462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09462","snapshot_observed_at":"2026-08-07T00:26:05.409485Z","title":"SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video","venue":"cs.CV","work_id":"1164429b-84ae-41f1-b3a8-cba66b974c4b","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.023665Z"},"links":{"cited_paper":"/paper/2406.09462","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d19c1a7cfe71044b0c7ac8b8f331534c144e6f234e9b17c3c5201bf085ef9332","observation_id":"c85f5577-4f51-4526-b62d-8f395bb174e9","resolution":{"observed_at":"2026-08-07T00:26:05.459079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.045025Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a411e3c0-e8d1-4e8c-b1a3-ab7fabe79527","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.111484Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0091510a00aefc255d444dc22c13e8e27780e65e560adeabfa35e0a7ee6af0e7","observation_id":"5ecc0798-5e90-4dfe-858a-40557e35fb32","resolution":{"observed_at":"2026-08-07T00:26:06.125884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T00:26:05.197274Z","title":"DistilBERT, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.197274Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:2ab3d84beddd5b4124020b1e2fd971817a8cf6ef6ea88d9f64e2c66849ee390e","observation_id":"4be5b5db-e73a-4a44-8640-2a6d06e242af","resolution":{"observed_at":"2026-08-07T00:26:05.197274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T00:26:05.265658Z","title":"RoBERTA: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.265658Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0905861280797b419b4881ab591c1187f15b3b5702a138b4424b5def804013a1","observation_id":"784e0a32-bc55-4749-9325-564a43c2f4c0","resolution":{"observed_at":"2026-08-07T00:26:05.265658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:15:38.945528Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.14356."}