{"as_of":"2026-08-07T19:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2cdc0e11cbe459b25d306177872bb19ba4593d8ec5c57ae5474d042a14cf030","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:31:42.599141Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07886/citation-record","integrity":"/paper/2506.07886/integrity","json":"/paper/2506.07886/citation-record.json","paper":"/paper/2506.07886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.346223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.346223Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b6e203932f9e5dd79e84e48329bb5517537ad85dae6de89965f2e3514a94694c","observation_id":"15894f6c-633e-4832-806d-3e43a6a26cda","resolution":{"observed_at":"2026-08-07T05:31:42.346223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.349741Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.349741Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0ad7c0441999940b0d6401bf829cf571eab5f5660a353322f0335bbbb7b1745c","observation_id":"0a8f9399-7488-4ef2-a179-2678ae232f49","resolution":{"observed_at":"2026-08-07T05:31:42.349741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T05:31:42.352925Z","title":"Cosmos world foun- dation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.352925Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:fca87add970997bcfa427fb246cbf1937e021ad0b6cc02a02bbfb094f38ce8b9","observation_id":"cf5137c5-86e3-4333-9e18-23dcab4e0c56","resolution":{"observed_at":"2026-08-07T05:31:42.352925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.356074Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.356074Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a19e7a20bcdabf24a72499571da3e280465372e326d637eaeff0aeb8c38dabb9","observation_id":"f63069d3-06bb-4d13-8e40-4a4c0cd3b781","resolution":{"observed_at":"2026-08-07T05:31:42.356074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.358916Z","title":"Scenescript: Reconstructing scenes with an autoregressive structured language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.358916Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:df0692b02f29e22c1b17090081949c1364d5eebfaab570f3d09f41af852a18c6","observation_id":"7fad7658-0c0b-409e-886d-56e0c4d08177","resolution":{"observed_at":"2026-08-07T05:31:42.358916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.361669Z","title":"Newcombe, and Vasileios Balntas","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.361669Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:041b8c2c25c0a886ac51e0cfd5878fe1a91a4d12399846228ec0a27375c5b8f1","observation_id":"0617dc0d-0e34-4703-96c7-c1db19e69ccb","resolution":{"observed_at":"2026-08-07T05:31:42.361669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.364505Z","title":"MultiMAE: Multi-modal multi-task masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.364505Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:93a2085a8daffa9c693d3cc23a5dd9f47a1b0b6fccc822398dfa0005555bae61","observation_id":"bc8ce495-3b8b-4b19-bc39-a6519066f386","resolution":{"observed_at":"2026-08-07T05:31:42.364505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.366966Z","title":"4M-21: An any-to-any vision model for tens of tasks and modalities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.366966Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:74b00a958d82d7ab0441068c19450106e12c13a16485b68fb419059b9d14ba58","observation_id":"449cfd9e-580e-4616-901f-ab5e8a91cdd1","resolution":{"observed_at":"2026-08-07T05:31:42.366966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.369371Z","title":"Lending a hand: Detecting hands and recognizing activities in complex egocentric interactions","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.369371Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:63e7476249c96a077c127430a01155a5c92336cc5e9dcb8f0ece0bc72d68a4cf","observation_id":"13c506a7-8635-4d99-9918-5431ab0404ce","resolution":{"observed_at":"2026-08-07T05:31:42.369371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09598","last_updated":"2024-06-13T21:38:17Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T21:38:17Z","title":"Introducing HOT3D: An Egocentric Dataset for 3D Hand and Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09598","snapshot_observed_at":"2026-08-07T05:31:42.372012Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking.arXiv preprint arXiv:2406.09598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.372012Z"},"links":{"cited_paper":"/paper/2406.09598","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:98858b0c6218c57b4659fe48bc8652b931a967843559f6e36a29acf8cbd53210","observation_id":"f68b6e4d-f5d9-4ffe-b548-1bef9b959f7b","resolution":{"observed_at":"2026-08-07T05:31:42.372012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.375059Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.375059Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:87354dd3c7234f66faceb4af4de43a22d737d2d4ceefe4eba296cdaabb17cf94","observation_id":"b8f5cdf0-83c4-44f1-8530-eb19bc33e420","resolution":{"observed_at":"2026-08-07T05:31:42.375059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.377428Z","title":"Align your latents: High-resolution video synthe- sis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.377428Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:001fff54ae77dc221a892e6df4029ee6db42283053e3bf5589226a7acf6916ce","observation_id":"49ff6499-ee5d-430f-8f77-31886228d558","resolution":{"observed_at":"2026-08-07T05:31:42.377428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.379761Z","title":"Scene coordinate reconstruction: Posing of image collections via incremental learning of a relocalizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.379761Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:d7f7d62b644a2bf4dddd81e5e2df8912543d07da56c8de39474b433cbc9b5fa3","observation_id":"541dd731-2077-4ef5-b5a6-00c8efb30f53","resolution":{"observed_at":"2026-08-07T05:31:42.379761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.382148Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.382148Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:6887e77a82c1c234e200b56d32124200e59aa876ac00b42fa8431529853c122c","observation_id":"a852ea0f-f485-4732-8c3c-2aa14db15dee","resolution":{"observed_at":"2026-08-07T05:31:42.382148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.384474Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.384474Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5dac29581b5d620c1d01d0f5a0701bc1f8ef4f228422431d794b04262b50e2df","observation_id":"5c1d5162-9dbf-4d9a-b756-670d26569b51","resolution":{"observed_at":"2026-08-07T05:31:42.384474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.386991Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.386991Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8f6f655f209ed0cbec18932f7478dbb9e34fe0adcc7db6b75a7eabdf0fc22d9a","observation_id":"3f9630f1-da1a-4b4d-9abd-2f82a4159002","resolution":{"observed_at":"2026-08-07T05:31:42.386991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.389243Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.389243Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:7854dd5f4d72db3abb54a2f7556e34ac7bda45876b3c30cdbe561fda27807376","observation_id":"15fb6131-0fbc-44c4-a196-1853f71245d8","resolution":{"observed_at":"2026-08-07T05:31:42.389243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.391946Z","title":"Fleet, and Geoffrey Hinton","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.391946Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5984bb7bac77cca6f01367dc89571e54ad755b2b028c452311e949824f49d5fa","observation_id":"f6e90f27-0f2f-4cdd-98fd-c557c5db6b1b","resolution":{"observed_at":"2026-08-07T05:31:42.391946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.394269Z","title":"Control- a-video: Controllable text-to-video diffusion models with motion prior and reward feedback learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.394269Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e585430e811c5155dc776c14647c0cf1587609aaaf9aa044d6f05ee35c5665c2","observation_id":"8afff46f-d8e4-473d-8a61-84d53bd87593","resolution":{"observed_at":"2026-08-07T05:31:42.394269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.396601Z","title":"Scaling egocentric vision: The epic- kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.396601Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:983791dc685cb6f4cf006d7745b23112a2cf873525f50c0ad807f6e35edb819a","observation_id":"2b910072-2163-4309-89dc-77bd1f85f945","resolution":{"observed_at":"2026-08-07T05:31:42.396601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:31:42.399010Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.399010Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:62c3a7d1f4dd16ba57e6d097a1baa72c298883d6441f4e46ef9dfe753d3c0794","observation_id":"00a2618b-7fce-4b42-9bec-9b401e93b5e4","resolution":{"observed_at":"2026-08-07T05:31:42.399010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.401827Z","title":"Structure and Content-Guided Video Synthesis with Diffusion Mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.401827Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:3520db64ec391ecc1a2c8980e655f96238e69d0833ca27be3e9ad8df428ecb76","observation_id":"6d95ac89-690b-435f-af8c-9526af2a8c0b","resolution":{"observed_at":"2026-08-07T05:31:42.401827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.404240Z","title":"Black, and Otmar Hilliges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.404240Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:96fd2a05b7c5f4168fe24f0271fce34341b34f8f235c7701b1c290e1f9796557","observation_id":"34ffb50e-9f66-460b-8ce2-7ad3e4a53694","resolution":{"observed_at":"2026-08-07T05:31:42.404240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.406558Z","title":"HOLD: Category-agnostic 3d reconstruction of interacting hands and objects from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.406558Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b6f86adaf7fc7cb35fd2f591c24f80a0ccdf73872f4f3c11521a72f52a4d143a","observation_id":"3dfc6897-3adf-4384-893a-18b9fd95211d","resolution":{"observed_at":"2026-08-07T05:31:42.406558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-07T05:31:42.408928Z","title":"Violet: End-to- end video-language transformers with masked visual-token modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.408928Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e338b3c77d7aa28faf813d2dd2b4ecccd72ca081b7f25327a0916b04f65c017b","observation_id":"505417fb-eae6-4fa0-b2de-e1c0b6e9f9d2","resolution":{"observed_at":"2026-08-07T05:31:42.408928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.411701Z","title":"First-person hand action bench- mark with rgb-d videos and 3d hand pose annotations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.411701Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:1ba7e8a1bb818050dfb2e48762f17d3a8f31d018136fd04ea4d80b1532cc3863","observation_id":"55a2aeec-0259-4acf-8ae5-04c17ce47536","resolution":{"observed_at":"2026-08-07T05:31:42.411701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.414302Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.414302Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:18956658d20e8c2eea7cf554369bf668f0b8d2051c1213b81f3fb9f8d1894288","observation_id":"5fd4f5f4-7520-4d04-a576-e2df90ba89ff","resolution":{"observed_at":"2026-08-07T05:31:42.414302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.416754Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.416754Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ac0c14503eccfb6f5291d249a2bbeafa0879c7db65728439bf4441e5ddd97b00","observation_id":"9e5a3b5b-3cb4-4816-a31b-6ad45b96c684","resolution":{"observed_at":"2026-08-07T05:31:42.416754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.419200Z","title":"Ego4d: Around the World in 3,000 Hours of Egocentric Video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.419200Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a4b2fe03bdb9587f80c0146063663ffec8fcc45b594e6d146ada40eb5c8541d0","observation_id":"0801895d-a503-4cb6-a12f-0c36348f3d69","resolution":{"observed_at":"2026-08-07T05:31:42.419200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.421469Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspec- tives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.421469Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:6397ffebe0700c5de93f1b4f284b945c3f9905936ff5ff322e247a621fcd6fc2","observation_id":"bcf61676-1751-4004-80ab-d9232c3a7592","resolution":{"observed_at":"2026-08-07T05:31:42.421469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.423750Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.423750Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2924b72eb83229e900b5a2a1fc2459d5dc2bd305715d9a0d6d3e6018b173c642","observation_id":"59fcde70-c33c-4575-9deb-69eab36e6483","resolution":{"observed_at":"2026-08-07T05:31:42.423750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T05:31:42.426124Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.426124Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:72154458607efb121bb441bc99f6b80c71f6c8780265240bf7e642eb770ecef4","observation_id":"9af1b819-83cf-4904-80fc-840d4704c4aa","resolution":{"observed_at":"2026-08-07T05:31:42.426124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.428661Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.428661Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:889b3fa9930539901c1f9a86a8594f40c09650ff5ada6ed4002eefb15db2fcbe","observation_id":"7c1575ea-1ee2-4ed0-8020-9e970c0fd46a","resolution":{"observed_at":"2026-08-07T05:31:42.428661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.430965Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.430965Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:766a4055491a21e2c06331b244b64bbf2f9b50d943b8c911b738a4205623c449","observation_id":"cfecc510-d9c4-4fa7-8696-949fad01d9f0","resolution":{"observed_at":"2026-08-07T05:31:42.430965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.433709Z","title":"Video diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.433709Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:85bbddb72cd23ee057416b143183a1a204d8b6d561998f294ee27c88a8b74098","observation_id":"c087ee39-de85-40d5-ab00-c371152241bb","resolution":{"observed_at":"2026-08-07T05:31:42.433709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.436271Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.436271Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9a6374c4b34ae175ff5e79123bce5062b02c5af31f08bc29266417ca01c832db","observation_id":"4a4af980-0b14-40ca-abf4-c16d7b4263c4","resolution":{"observed_at":"2026-08-07T05:31:42.436271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.438690Z","title":"Cogvideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.438690Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:d279bb4ad9a09078677d9f84bd8618693a1e91b116b10ecf7702d15a1d47ac8a","observation_id":"7c459429-91fc-4ea3-a3cc-f48d486d3cf5","resolution":{"observed_at":"2026-08-07T05:31:42.438690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.441013Z","title":"Gritsenko, Jasmijn Bastings, Ben Poole, Rianne van den Berg, and Tim Salimans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.441013Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:563967747b37e96a4a2e63be61203d43c76fb045d63dfbe1f45ea8685192e57f","observation_id":"1e6a5851-42d7-4baf-be4c-4db19fd1e816","resolution":{"observed_at":"2026-08-07T05:31:42.441013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.443348Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.443348Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8ab7e8f264c8c006f4b552bdd0af2600f43502a0be0943a48ef7489a905b36b1","observation_id":"0ff59b2a-d994-4462-9651-ffcf2ec61f47","resolution":{"observed_at":"2026-08-07T05:31:42.443348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.445693Z","title":"Predicting gaze in egocentric video by learning task- dependent attention transition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.445693Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0a19fa90c5effa2d0ed12d42d6ef2ee382c88b22203116a500ad594e57300db8","observation_id":"d63a9227-59ab-40b8-b469-aae67ab99370","resolution":{"observed_at":"2026-08-07T05:31:42.445693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:31:42.447923Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.447923Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:da796dc879b4bfa02127a3d79b2bffd1c3229095d723e91c16d42538c9c3983b","observation_id":"2a3c13d0-fb71-46ce-b967-3ad57c9ea5f2","resolution":{"observed_at":"2026-08-07T05:31:42.447923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.450515Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.450515Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:377f928c3cf6701d89dffeb98e1e93e08b90426cbca684541bfb349bd51442f8","observation_id":"400f5c80-0591-4a7f-a8ab-ffd96cbb14b8","resolution":{"observed_at":"2026-08-07T05:31:42.450515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.453671Z","title":"Re- purposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.453671Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:fe45cf5df33e0fe3f0bed11430382c131f68cfcb9725158677e96db5a4635931","observation_id":"04454c8a-dc38-4169-a86b-a8039f528166","resolution":{"observed_at":"2026-08-07T05:31:42.453671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.456344Z","title":"Video depth without video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.456344Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:205b9700c581bac2fa181dca2ee9369a0053fdb7a134e04076f0d4c64d9824f2","observation_id":"c185bded-22cc-4cc7-bf12-3d5c9ceec635","resolution":{"observed_at":"2026-08-07T05:31:42.456344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.458614Z","title":"Text2Video-Zero: Text- to-Image Diffusion Models are Zero-Shot Video Generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.458614Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:26e8cf1fea867f295552d3b62c7a9230dd8ded4bb27e627d91de74e4d75d595a","observation_id":"36c03888-f351-40d8-834e-23e0d4fd5506","resolution":{"observed_at":"2026-08-07T05:31:42.458614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.460971Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.460971Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:de13031c42ebacdcc9a6ea1829acc012310ac6a7f7c52ae834476437360b68a8","observation_id":"306b8dd8-70c4-4016-8e9a-b90231c1cee4","resolution":{"observed_at":"2026-08-07T05:31:42.460971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.463435Z","title":"Harmsen, and Neil Houlsby","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.463435Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a7a8d4991f29d6694cbdba045d6db072a5f21ecfb0bd4bfb0d9a3fd32de4a3cb","observation_id":"85cfafe2-386a-4e0b-a8b3-b6856a206452","resolution":{"observed_at":"2026-08-07T05:31:42.463435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.465709Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.465709Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:4e0ff33d9b486dd2145133d89291e0eb813bd998188a05a5f903fc318e4bef3b","observation_id":"56202ac3-0576-4504-b221-2e677d77f744","resolution":{"observed_at":"2026-08-07T05:31:42.465709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.468298Z","title":"H2o: Two hands manipulating objects for first person interaction recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.468298Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e5e2c63860e545f51a88989d9cfc8cfb0b381cdd4497f87f8f71e714e7a196ae","observation_id":"8aaa8fa9-d631-4558-9fcf-3e60bf0ae668","resolution":{"observed_at":"2026-08-07T05:31:42.468298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.470764Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.470764Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ee7f67b96315ad18fa1d7b3044fbed4447c08c98d5d4e26955bdc3e21677b2a0","observation_id":"4caa288a-432f-4f65-affa-3db175476b05","resolution":{"observed_at":"2026-08-07T05:31:42.470764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.473203Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.473203Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:237b4ff890f651f88846c50c960ab14bc56313f222c115daf753b901067b4838","observation_id":"a82b8a1d-6305-4cfa-93db-c0ffa7b3405a","resolution":{"observed_at":"2026-08-07T05:31:42.473203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.475810Z","title":"Egogen: An egocentric synthetic data generator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.475810Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:25cd3ad401427316cd49302c442f0c6bfa706c526a1924b769fcfcc6678cb986","observation_id":"31d3e8ba-650b-4fb4-992f-ca9afb0f6ad1","resolution":{"observed_at":"2026-08-07T05:31:42.475810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:31:42.478451Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.478451Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e1498f42e93b1204eeb55267e68cf6b49fb6767c03570b7f384a778aff6a16d5","observation_id":"f4bd1b8c-c516-46d8-a784-fb266f7e1a4f","resolution":{"observed_at":"2026-08-07T05:31:42.478451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.481256Z","title":"Megasam: Accurate, fast and robust structure and motion from casual dynamic videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.481256Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:d9eed68d2953e8d1b620241d5f2e67544f4fc7ade0ec7648aa726bc5a2361f78","observation_id":"aec46962-59cc-45c6-acbc-8457da029965","resolution":{"observed_at":"2026-08-07T05:31:42.481256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.483820Z","title":"Video-LLaV A: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.483820Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5df3b5f6985ba736726fcf6a351ffca11cf8f6d5ba868dc15fa5f21a5e92f8cb","observation_id":"45d097af-9a90-49d3-91e0-60c25371e42e","resolution":{"observed_at":"2026-08-07T05:31:42.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.486760Z","title":"Cross-view exocentric to egocentric video synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.486760Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2e192b07c4aad5c5d212fe259fb11726f88e0c5c45411e46de4b085553c07568","observation_id":"3e263881-3e9a-4794-86af-d218551e21ae","resolution":{"observed_at":"2026-08-07T05:31:42.486760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.489037Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.489037Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:6a5999f7459f8710465a5737330970a4b0e18635a31fb278e0e1d9524fb16ea4","observation_id":"01a27f75-5b00-4edf-8daa-383a5ad7a7c2","resolution":{"observed_at":"2026-08-07T05:31:42.489037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.491572Z","title":"Exocentric-to-egocentric video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.491572Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:653bc407624403652df0d2661ecede2cbc0b760281273ce502e1a06b6899acd7","observation_id":"6b3c69ab-e05a-4fbb-b93b-29013773e9f4","resolution":{"observed_at":"2026-08-07T05:31:42.491572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.494202Z","title":"Li, Ying Shan, and Ge Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.494202Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b78cf38159782eb7842be68cbe79ae1f715c01e59530c76b48b0d35610521c90","observation_id":"6f7ff5ef-cb26-4e70-a7fc-dc3429d9c4d3","resolution":{"observed_at":"2026-08-07T05:31:42.494202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.499922Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.499922Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:3a2b2ad24c3532d807e2de877ad7bc7ed7d8d9185e133a462ac08eed9431e1a3","observation_id":"fee22a39-4c72-4ac1-8728-4142f468e909","resolution":{"observed_at":"2026-08-07T05:31:42.499922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.502461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.502461Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:09f551e2354730a44e70b00ef5810694b8db0ef78c11e3b5807b30ab799807a8","observation_id":"baa0c2cf-52c5-41ae-99fe-26b4bc392390","resolution":{"observed_at":"2026-08-07T05:31:42.502461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.505098Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.505098Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:18429129901577a8dd80f6333d3d284a0c071dae252768190e831618c9eb4d85","observation_id":"9064648b-65c1-4b38-a48f-fdd5d5acbc60","resolution":{"observed_at":"2026-08-07T05:31:42.505098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.507569Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.507569Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b83c88a3a56985c8ea7f21350f46152206d7d27be231fdaf85f47f9ec3814967","observation_id":"b95d2052-f35f-4041-8469-e7085267b8e4","resolution":{"observed_at":"2026-08-07T05:31:42.507569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.509938Z","title":"Unified-io 2: Scaling autoregressive mul- timodal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.509938Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f7d8f83a870f7b103b64eff44a6bf88b994780247468cf8d28cf9cf3aec4926e","observation_id":"d35445cd-14d2-407e-a5e3-3c65dc60ab61","resolution":{"observed_at":"2026-08-07T05:31:42.509938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.342370Z","title":"UNIFIED-IO: A uni- fied model for vision, language, and multi-modal tasks","venue":null,"work_id":"10059363-e6ad-455b-870c-f3faae31d7ad","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.512343Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:1d71a282f991b43f6b4857ff93c74a677c8ab50b91eb61bb3812f69c411dbaa5","observation_id":"4ddd5a67-06cf-42cf-968e-3ddfee63a802","resolution":{"observed_at":"2026-08-07T05:31:43.345152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.334826Z","title":"Align3r: Aligned monocular depth estimation for dynamic videos","venue":null,"work_id":"d26f450e-f820-44d1-a518-92cc32bd4c17","year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.515421Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:14b5192eaebb21521e2ef73c9a318befcc57c4b92efc009644f3a7617e7a7e54","observation_id":"a87fcc94-61c6-4fb1-a7f3-9790ca147d68","resolution":{"observed_at":"2026-08-07T05:31:43.337663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.327287Z","title":"Dream Machine","venue":null,"work_id":"8e24fa1d-966b-4c1b-8843-bdec4198b161","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.518003Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c1aaa0b026338487d99e66e4215d66889287d899fbab0dab4605eaae3fd9f14e","observation_id":"e196fdd4-630d-480a-8b97-1abbf6d199b6","resolution":{"observed_at":"2026-08-07T05:31:43.329825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.319722Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"13e1ea40-0ec3-4bfb-bad6-e892c88dde0a","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.520485Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:cdd4d84df7070017a6684ca4071be669e2502d673d07da2a2755691ef781dcc4","observation_id":"85040bb0-72f9-4587-923d-e6ba6321b337","resolution":{"observed_at":"2026-08-07T05:31:43.322374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-07T04:03:49.639867Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-07T05:31:42.522928Z","title":"Aria ev- eryday activities dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.522928Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5f2f1a270d12e4a197ce23c3a3be2cded99fada75ea070d59f0af740507a5089","observation_id":"b49d3759-826d-4058-912b-f96bc2c8be84","resolution":{"observed_at":"2026-08-07T05:31:42.522928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09905","last_updated":"2024-09-20T01:18:11Z","snapshot_observed_at":"2026-08-05T08:51:51.094594Z","submitted_at":"2024-06-14T10:23:53Z","title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09905","snapshot_observed_at":"2026-08-07T05:31:42.525404Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.525404Z"},"links":{"cited_paper":"/paper/2406.09905","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:11591632521947b214c9bf75fe146fb2a427b4e3430b157ff26231173944d846","observation_id":"b6e9ab21-5033-431c-80fe-6db7083e494f","resolution":{"observed_at":"2026-08-07T05:31:42.525404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.311929Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"88bd040d-3cda-482c-a0cc-8fe41ffda9e1","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.527939Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:daa5cf96b0cc2ab7a719c6969d126883ff93b3e96e3b0de18aaea5eb539a2c2a","observation_id":"1fd07221-c02f-4ec3-a438-49767fe5dfa2","resolution":{"observed_at":"2026-08-07T05:31:43.315038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.304109Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training, 2024","venue":null,"work_id":"4c6099b3-05a4-43cf-8a80-3fc42ed0c5ca","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.530377Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:20aee4965a89188f441c2ed2b3a067ad32175a56df9c5ce1756cbd6188466848","observation_id":"9977c314-da17-4ddf-b118-483416f1e3f9","resolution":{"observed_at":"2026-08-07T05:31:43.306917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.297097Z","title":"Project Aria Glasses","venue":null,"work_id":"4148ef05-4a89-4d54-9119-bc9f757ab41f","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.532866Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:3b7a182a6a1bf358e781093bf2339f32aa70e73eede9f8ac418be872298945b8","observation_id":"d9deb7a6-65ed-4c3a-b7db-84c72c36390f","resolution":{"observed_at":"2026-08-07T05:31:43.299588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-07-06T13:47:58.509110Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-07T05:31:42.535714Z","title":"Trans- formers are sample-efficient world models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.535714Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e3f44825ff2ec89f1f3f05a80412bcb21e1fc1904d8bb3717e042dd083679c3b","observation_id":"8ba322c7-646c-418d-9622-261ee4a5c97b","resolution":{"observed_at":"2026-08-07T05:31:42.535714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.289793Z","title":"HoloLens 2","venue":null,"work_id":"4e69ff22-0f22-4919-8a74-83e46b129d1e","year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.538301Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:dab9cea7adecf67d759588477ed5151d5f6693541c0b63d7673fbdb1f0b9cd61","observation_id":"5dc57102-cd1d-463d-b21a-8dcf0ada7d48","resolution":{"observed_at":"2026-08-07T05:31:43.292402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.282406Z","title":"4M: Massively multimodal masked modeling","venue":null,"work_id":"1913f39d-6914-43b1-869e-e4ae4aba1af5","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.540832Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:fe4abc8d56c00baa6d5c01c2cacd35ba35734a25e478fd4a4ed716faec5c621d","observation_id":"c137608e-1b3b-4edf-bd0f-d879c2a3dbf5","resolution":{"observed_at":"2026-08-07T05:31:43.285124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.274975Z","title":"AssemblyHands: towards egocentric activity understanding via 3d hand pose esti- mation","venue":null,"work_id":"fe5a4712-3767-4881-a1b6-5157fb70a0f2","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.543229Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a508b17b3362bf18f7182139f13113f3f2c7f5baf07a7ab679cdf1e707bcefe6","observation_id":"b4420ba5-ac62-4b89-b5cb-6046902b1220","resolution":{"observed_at":"2026-08-07T05:31:43.277532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.267007Z","title":"Video generation models as world simula- tors","venue":null,"work_id":"e25a893e-434d-4153-8c19-f0fb84ac30d9","year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.545537Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:d07112070ba35335d08aad8ecc9645cf6f8176271575cf426d84054ca1cd01bc","observation_id":"c79c1e4d-4e9a-4db0-aae0-0eff5aeb866a","resolution":{"observed_at":"2026-08-07T05:31:43.269716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.259777Z","title":null,"venue":null,"work_id":"bafd4369-fe89-4648-a73e-c7d35542482e","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.548214Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f76c0e39a3a3df8f98809aa03a085d2d6688bcc4230e7bb608c8318d2d581232","observation_id":"374a7076-4d4a-4983-9a51-fd3c31220660","resolution":{"observed_at":"2026-08-07T05:31:43.262258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.251429Z","title":"Aria digital twin: A new benchmark dataset for egocentric 3d machine perception","venue":null,"work_id":"6512ee24-73b4-4c66-83e3-457641ee99fd","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.550637Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b3cc71158f78fbca9c49e5cbe3d794fdab267b3129f47fe6f73b2c77058498ac","observation_id":"3fb761d3-f991-4650-a924-fac389397dcf","resolution":{"observed_at":"2026-08-07T05:31:43.254661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:31:42.552979Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.552979Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e145a5bb5e38f147cd08507d378d38983e8917934a9d8d1a899c3112792d8de0","observation_id":"b0563564-1aa4-491d-a10b-6305dffedad5","resolution":{"observed_at":"2026-08-07T05:31:42.552979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.242973Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"7a4f782a-7814-42a9-9af4-37e0301b7b20","year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.555752Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9cbbf72b2995ef29c22786850787baf316db755d1581377fdeb8acc15e7e3f32","observation_id":"2a104cc6-49f3-486a-a341-1b1e0f6f3a57","resolution":{"observed_at":"2026-08-07T05:31:43.245929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.234881Z","title":null,"venue":null,"work_id":"47f6e3cb-3a9e-48fa-9d45-de50d0b8c161","year":2020},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.558132Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8c7a98d638f10b890df850a7f55c8b2abffa8a6a240c0b21089012e4b8d895e9","observation_id":"43e157ec-730b-452b-8b52-c5821f2d7f52","resolution":{"observed_at":"2026-08-07T05:31:43.237643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.226456Z","title":"High-Resolution Im- age Synthesis with Latent Diffusion Models","venue":null,"work_id":"5e01c818-9c96-412d-8f56-663646060cf1","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.560589Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ca0ccad550730cfbdc9056057c2bcf804d8bc383d3c68db72ab3adb20187b791","observation_id":"64ae6b91-6d2e-4268-bbab-dff2f7364b2d","resolution":{"observed_at":"2026-08-07T05:31:43.229469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.218459Z","title":"Gen-3 Alpha","venue":null,"work_id":"74509dc9-5564-44be-8606-85a82988e5af","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.562991Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9d27651c2f945961a0144d6be5cbdfeb9a82e2375a264f31b13757c5e127cb3b","observation_id":"b3f70a23-1293-4c39-9ff0-f360abc10974","resolution":{"observed_at":"2026-08-07T05:31:43.221152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.209427Z","title":"Lamar: Bench- marking localization and mapping for augmented reality","venue":null,"work_id":"4196d515-52c2-4037-9a8f-60310db1bc68","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.565470Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c14a78b518543d91b97b3860dcdc745af26798261c8af9a52b41352174fead75","observation_id":"66bddc3a-7e9c-4f03-bd41-b88c485106d3","resolution":{"observed_at":"2026-08-07T05:31:43.212813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.200788Z","title":"Sener, D","venue":null,"work_id":"41a3851d-50c5-405e-bbf9-870d46ce3d06","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.567826Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:7d6152fd9c4d3aceb9a43976f858e9a7daf07b4a78cd908a00485699805f53e2","observation_id":"07d1e775-b7d6-4c92-94dc-a1b1a51ed7b1","resolution":{"observed_at":"2026-08-07T05:31:43.203556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.570245Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.570245Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ef72f8d9af87f31a5aae657677079e6177d11c6203bb2a8ccc3adb74e90df8bf","observation_id":"ee2d64bc-3bc5-478e-af14-5ff57d27f4ce","resolution":{"observed_at":"2026-08-07T05:31:42.570245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-07T05:31:42.572653Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.572653Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2581cb1fb16d44bf1b422605a312526e14de7190eb93ac9f6b8f224dc133d285","observation_id":"2706b4d7-8665-4f5e-9dc2-06dd67743634","resolution":{"observed_at":"2026-08-07T05:31:42.572653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.188191Z","title":"Part, Ioannis Papaioannou, Arash Eshghi, Ioannis Konstas, and Oliver Lemon","venue":null,"work_id":"0afe7759-4f95-4ebd-af1c-16c4de590021","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.575522Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e92aa92254b4d54dc283357eca3a101b9391753197e46289a134426442f81db8","observation_id":"c84926b5-1768-451c-b056-ae70ede2ec88","resolution":{"observed_at":"2026-08-07T05:31:43.191261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.181007Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"dfedd122-dc92-4322-abd0-1a9913e81cfb","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.577766Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:85d068aa88f8a776fc18be1dda05ff912cf0378fdc64c4845e25f5ca955a9f15","observation_id":"c5e558a0-b2ed-4d3d-bf55-4fb269ab28b3","resolution":{"observed_at":"2026-08-07T05:31:43.183503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:31:42.580076Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.580076Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e7fdf89e90d5e6f2f88fa3b3f8c3d1abe1dde28aabd6f6126949d64653af9b98","observation_id":"9ba77c0d-e496-42e5-a6c2-5147d5e6eb40","resolution":{"observed_at":"2026-08-07T05:31:42.580076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.173742Z","title":"Kling ai video generator","venue":null,"work_id":"cb651866-6b55-4a82-a602-130250c88786","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.582501Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ff40fec7b046c0a2a8c9780c4eb165b13dbf807fdf2a2ea56e511e71dfd83e1c","observation_id":"522fd6c4-b46a-4fc0-b37e-a072ab425b44","resolution":{"observed_at":"2026-08-07T05:31:43.176365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.165383Z","title":"DROID-SLAM: Deep vi- sual SLAM for monocular, stereo, and RGB-d cameras","venue":null,"work_id":"21ae3a76-dd9c-448e-8694-e30bdee81b04","year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.584808Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a7a09de376cebc7aae63ba5bd1a89234c73d46c61460bf3a40554a0d9d1039b7","observation_id":"e8559f55-245d-4006-a0d8-af30007aedce","resolution":{"observed_at":"2026-08-07T05:31:43.168267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.157048Z","title":"VideoMAE: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":"03ed9ee1-360d-48de-81e7-3824ef167c65","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.587075Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:23adfdf6ec0a7347b3e436557f70be4837d41dd2224658ac93e8f84c1108c072","observation_id":"2fa6a850-a295-4b97-a6bc-d0ddc6ddd58f","resolution":{"observed_at":"2026-08-07T05:31:43.160061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.148290Z","title":"Towards accurate generative models of video: A new metric & challenges, 2019","venue":null,"work_id":"bbd3a3bc-d4b3-495c-bfef-36bafda6eef8","year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.589235Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9ef4aa17f2ced33f01ed3d6c058866e6f8d4988e9c4be33d7a6dfc405f3b4e97","observation_id":"2a8dbe85-a2d5-4cb7-a498-9d7c352ce84d","resolution":{"observed_at":"2026-08-07T05:31:43.151538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T05:31:42.591660Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.591660Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:85771588010161abb82ccbcd9a5ca22f16dd6ab0fb03cb55d4c68b06fe59ca97","observation_id":"1e2f2197-f1ed-4ec3-9ad4-e1979f876097","resolution":{"observed_at":"2026-08-07T05:31:42.591660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.140086Z","title":"Neural discrete representation learn- ing","venue":null,"work_id":"12c86dfd-4144-431d-b41f-dc62d3043d22","year":2017},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.594555Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5879c92bc7f95d1d7a79e158b58be7aea60682f212063f79692e51efee607b5e","observation_id":"7e673542-0d8e-4206-bd37-c9d6f93d6215","resolution":{"observed_at":"2026-08-07T05:31:43.142981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.131936Z","title":"Attention is all you need","venue":null,"work_id":"e3e40857-6603-4c0b-895e-e63a79e1013d","year":2017},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.596902Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b75498ff953beaf8110530c2a06efec8673d3d2f6d53fab7bd4d6d6bae40c09c","observation_id":"3fc44bf5-10be-4363-8f68-d9a1423b43b9","resolution":{"observed_at":"2026-08-07T05:31:43.134665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.123207Z","title":"Phenaki: Variable length video generation from open do- main textual descriptions","venue":null,"work_id":"fa007d6c-9927-4fe1-a278-a819ca9f7a59","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.599141Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:98fbc600b6c9c654c61ee09997f6cdecb3a0e5cc8ef6470f8f61bb67c47a5b87","observation_id":"f383cfda-5eff-479b-b21c-46daadaed112","resolution":{"observed_at":"2026-08-07T05:31:43.126418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:01:29.957060Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 0 inbound Pith citation observations for arXiv:2506.07886."}