{"as_of":"2026-08-06T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:868514af1c52c0c0208b01aea53f79acfb56ac11d37f4594459811cb5f5f1e31","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:43:48.452812Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:49:58.824241Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04085","snapshot_observed_at":"2026-08-02T02:49:58.824241Z","title":"Unique lives, shared world: Learning from single-life videos.arXiv preprint arXiv:2512.04085, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-03T05:46:27.339391Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.824241Z"},"links":{"cited_paper":"/paper/2512.04085","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:05ca68c994c313b2aa559370674d8f739dfa694a3798d2a403d5401929945261","observation_id":"78791446-e291-4a38-bbda-d49a52715330","resolution":{"observed_at":"2026-08-02T02:49:58.824241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.04085/citation-record","integrity":"/paper/2512.04085/integrity","json":"/paper/2512.04085/citation-record.json","paper":"/paper/2512.04085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T18:43:42.785374Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:42.785374Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:8fa72fa29067b61b1167ff66c8faa72d708a10a9e95fe859a22fdb699da1268c","observation_id":"d0f71884-f2f3-45f8-92b9-84c6650352e1","resolution":{"observed_at":"2026-08-03T18:43:42.785374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:42.886340Z","title":"Cross-view completion models are zero-shot correspondence estimators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:42.886340Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:a1514177ed263d9abca2fecc7de1a5d4b5aa3e146edfb06a7e4cf8854f937927","observation_id":"b0e0356e-481e-43f4-b05d-654ba05a840d","resolution":{"observed_at":"2026-08-03T18:43:42.886340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.057083Z","title":"Anonymous lives dataset - a private dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.057083Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:9716f274d3bc46a0e3b787c91a57e036cbfa625100da7b4419153d2d39e0db3c","observation_id":"e9be2665-004d-41a1-97e3-80ece0b92599","resolution":{"observed_at":"2026-08-03T18:43:43.057083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.177119Z","title":"Hpatches: A benchmark and evaluation of handcrafted and learned local descriptors","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.177119Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:e8d2fe766c4f04e0d7059acaf5332a70ce39a8a8aed80dd556ea87506d0d65f7","observation_id":"2345a7ba-8277-4c94-bd4b-2d461cd01700","resolution":{"observed_at":"2026-08-03T18:43:43.177119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.343526Z","title":"Revis- iting model stitching to compare neural representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.343526Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:9210acc40a8162eaac4286becf7d186b8fb35d3d6352bcd57a640ba5d4c60313","observation_id":"1e076b5f-6cb3-47c4-847a-b4bfd6569704","resolution":{"observed_at":"2026-08-03T18:43:43.343526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.447799Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.447799Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:fe7b1a99718cb4983bdbdeb7a27b122c63a5867c19f144979a975a19be86460f","observation_id":"0f6644c6-34e0-4167-a825-707b40c89189","resolution":{"observed_at":"2026-08-03T18:43:43.447799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-07-06T20:10:24.217625Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-08-03T18:43:43.563351Z","title":"Scal- ing 4d representations.arXiv preprint arXiv:2412.15212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.563351Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:829af3f11ffce3a19cc17b984f739e0a86beda617165fbdb4039babe8d665474","observation_id":"b38649bd-72f1-4353-8d6a-7c3454b70b61","resolution":{"observed_at":"2026-08-03T18:43:43.563351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.697566Z","title":"Learning from one continuous video stream","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.697566Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:8fd75e88754ee932eaa81013926992bff8692744761d447ca53146c903f7d126","observation_id":"cebf9dcd-facd-4f96-8752-bcdee61a0f42","resolution":{"observed_at":"2026-08-03T18:43:43.697566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.785687Z","title":"Multidimensional scal- ing.Measurement, judgment and decision making, pages 179–250, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.785687Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:4f87c85ecc770946970f24a85c34f49e075cab4fa55a531467fdb5314aa637b7","observation_id":"ea419e8d-713e-4162-85f1-1bdaa8aa51c6","resolution":{"observed_at":"2026-08-03T18:43:43.785687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:43.870676Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.870676Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:74ff3cf54da02e1709a94b68e0de06e585bb7738c20d407aefa1729c89b9cb6a","observation_id":"0d3a55bf-52c6-448e-b3fe-f64ba782dc9f","resolution":{"observed_at":"2026-08-03T18:43:43.870676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T18:43:43.944884Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:43.944884Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:6f0ee81c37c1682f222112e18a14af322d4233a24451b30df5e719debece77d8","observation_id":"8efb2bb3-a2b4-4e3f-94f3-9f4e4771c1ca","resolution":{"observed_at":"2026-08-03T18:43:43.944884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.041736Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.041736Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:383981b5a7b41809b2b190dfed38552950ec9d10c1e5c8efc326be5133ed52c5","observation_id":"15290a38-33d0-46fe-8282-ccd670e8f7f3","resolution":{"observed_at":"2026-08-03T18:43:44.041736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.136913Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100.IJCV, 130: 33–55, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.136913Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:4f2dc1b2deeda21185c91c563cef0ced7357bc69393b5de5660f926f6c541baf","observation_id":"2bd1dc4c-28a4-4898-bc3b-41aa6fb89f53","resolution":{"observed_at":"2026-08-03T18:43:44.136913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.249398Z","title":"Depthcues: Evaluating monoc- ular depth perception in large vision models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.249398Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:f102ed4dff473bc12c012f8c1706949e173e6f2f92a78a772547fdecb55e7e53","observation_id":"3c1825e6-fe21-436a-95d9-875ca8a5522c","resolution":{"observed_at":"2026-08-03T18:43:44.249398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.364161Z","title":"Project aria: A new tool for egocentric multi- modal ai research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.364161Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:ff2fc348e4afc805fcda2364ba9af8a99c598910f7548eb4ff8bcf535ab7e6e5","observation_id":"8a784ceb-68d4-401b-b3fe-14c47fc8f673","resolution":{"observed_at":"2026-08-03T18:43:44.364161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.479834Z","title":"Ego4d: Around the World in 3,000 Hours of Egocentric Video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.479834Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:a92be65204d6c1836180f7aadc7f1ecfbc2104b2f67da3a9eafe0ff53d2bf392","observation_id":"345b8eff-b409-4689-824a-713f80c8c5f2","resolution":{"observed_at":"2026-08-03T18:43:44.479834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.636196Z","title":"Siamese masked autoencoders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.636196Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:8d04158d49bdb83e4cf572fe7041e71b0717cb9d90a660bf030cf2c0de2bdb59","observation_id":"3d4e05e7-6dd2-4359-82bf-b549c552dffd","resolution":{"observed_at":"2026-08-03T18:43:44.636196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.752914Z","title":"Learning from streaming video with orthogonal gradients","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.752914Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:f96616972db0065c36d744497d0c79cac4d3447724fb44bdd6b0f7ccedd6f87f","observation_id":"bff055b0-3124-4ee5-800d-421ebf6fa16c","resolution":{"observed_at":"2026-08-03T18:43:44.752914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:44.872548Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:44.872548Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:f21ca0ea7b0d9dea4080ea6cf242d0cfc4e4ce9cec54c066ee65b6be40484e66","observation_id":"3c2612e7-4568-44b5-b85e-f9ae19604444","resolution":{"observed_at":"2026-08-03T18:43:44.872548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.012341Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.012341Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:630278a94015d97620a92ed9e24673773ab16a3092b6607ea5b30a7da780ffe0","observation_id":"d0a18343-580e-4cd3-b99e-2240788a5706","resolution":{"observed_at":"2026-08-03T18:43:45.012341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-01T15:05:23.324854Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-03T18:43:45.114739Z","title":"The platonic representation hypothesis.arXiv preprint arXiv:2405.07987, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.114739Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:0bc72c1fb0d1e2c0c00a3fdde5ba40bdf586687eb7167c5059dd1d0a735143e3","observation_id":"bbb50894-4253-4d50-81ed-63ccde9bdd94","resolution":{"observed_at":"2026-08-03T18:43:45.114739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.214117Z","title":"Space-time correspondence as a contrastive random walk","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.214117Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:7495089cc70f5ea9561e69b19b197d962ca1c30df98b32df32656f4cf0c1e396","observation_id":"dd45bd5a-dd67-4f94-897e-d9b820dd2445","resolution":{"observed_at":"2026-08-03T18:43:45.214117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.335134Z","title":"Harnessing the universal geometry of embeddings.arXiv preprint arXiv:2505.12540, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.335134Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:fff3343a59e80a382e6a6eb89f2b850c9686fc6eaab4a639528fc058fcda7431","observation_id":"e0e2176b-3a79-4a33-a8af-345c30cd1986","resolution":{"observed_at":"2026-08-03T18:43:45.335134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-03T18:43:45.428913Z","title":"The kinetics hu- man action video dataset.arXiv preprint arXiv:1705.06950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.428913Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:35df965a8ba01a7af53a9dc433a4a4fa30d86aa9c8896c82add08142881b4266","observation_id":"7a7dcb8e-061c-499c-ae8b-53ea6a8e57fc","resolution":{"observed_at":"2026-08-03T18:43:45.428913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.557725Z","title":"Similarity of neural network representa- tions revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.557725Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:3a9740a17375221b13bd05502116bf14612b9c330fdc4d98371a5207272c2ed4","observation_id":"cd5c822c-65c9-42d1-a76f-e03254b74426","resolution":{"observed_at":"2026-08-03T18:43:45.557725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T18:43:45.692285Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.692285Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:831b6e390669aa36478597d893390d876468f304ad854876e5bf615f1ea83837","observation_id":"e75bcb48-0fba-48bd-87d3-3df781f908bd","resolution":{"observed_at":"2026-08-03T18:43:45.692285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.786606Z","title":"Egoloc: Revisiting 3d object local- ization from egocentric videos with visual queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.786606Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:9484103758a55e69a37d9d0cb00ba5dd251af8c00dbda127dbca3e4085428620","observation_id":"c771b4e1-7b6f-40dd-bd4d-69d6af4c22ad","resolution":{"observed_at":"2026-08-03T18:43:45.786606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:45.868553Z","title":"Do vision and language encoders represent the world similarly? InCVPR, pages 14334–14343, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:45.868553Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:b8f06eab1c3dbbbeb5bab9cb8f34c86a4e7eb44e0350d7fdd4603ccb983049d7","observation_id":"90259259-6b4e-42e2-b1b2-3db7857a0347","resolution":{"observed_at":"2026-08-03T18:43:45.868553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T18:43:46.015923Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.015923Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:c24e30e7a9e679f312d7f31bce7561b1efff349d0aeae100b1e2910501ef1f8b","observation_id":"8c62fc1d-9ab1-4878-b1ca-97a9cb2521de","resolution":{"observed_at":"2026-08-03T18:43:46.015923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.141290Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.141290Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:bcd9376ba9adb4005d5871478a25155de3fec3fadcc43e8c81a1d07170a00cd8","observation_id":"8d4b319d-d7b9-4357-94b7-78d3b3050ac9","resolution":{"observed_at":"2026-08-03T18:43:46.141290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-03T18:43:46.272822Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.272822Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:936306932538d73e0aae1a0451e7e290e75bc54a1b88fba8b63de5f206101faf","observation_id":"a64c078b-b297-478a-b2c0-97afc9406d0b","resolution":{"observed_at":"2026-08-03T18:43:46.272822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.401996Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.401996Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:97dd4d18a40f88a21a63f4032bda06563328ddf3161aeacdea5f7e033f482013","observation_id":"38116f7f-9000-46ec-a9b9-9fb5a053505c","resolution":{"observed_at":"2026-08-03T18:43:46.401996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.477003Z","title":"It’s a (blind) match! towards vision-language correspon- dence without parallel data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.477003Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:0a3269fa0d7fae29884a934de5300ed1134b1a111c304a28ba20795e03316a95","observation_id":"f228106f-4937-4929-a836-0d7420e05a5f","resolution":{"observed_at":"2026-08-03T18:43:46.477003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.588204Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.588204Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:556d3f8a3e0f2c21763b92f4d0e65d655b76f7ae85cf2b39e405adfba136a6eb","observation_id":"95cac456-d049-4a6f-8825-cfbed178b8fd","resolution":{"observed_at":"2026-08-03T18:43:46.588204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.724155Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.724155Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:62c82c4302f2015a8cd65cca379152603027d974c38da029063b57ab82086132","observation_id":"ee81fe1d-9fbc-4c8e-9a60-79a36c7c50f9","resolution":{"observed_at":"2026-08-03T18:43:46.724155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:46.833035Z","title":"Raft: Recurrent all-pairs field transforms for optical flow, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:46.833035Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:aac7d53e38c65432f9b61354c205c64a8481b8873656bccfe3e75216ffa7a440","observation_id":"ae6a3812-6b19-46c7-b35e-d125de2ccbe2","resolution":{"observed_at":"2026-08-03T18:43:46.833035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16282","last_updated":"2025-06-13T13:11:45Z","snapshot_observed_at":"2026-07-06T20:41:01.690687Z","submitted_at":"2025-02-22T16:27:31Z","title":"Understanding the Emergence of Multimodal Representation Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16282","snapshot_observed_at":"2026-08-03T18:43:47.010177Z","title":"Understanding the emergence of multimodal representation alignment.arXiv preprint arXiv:2502.16282,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.010177Z"},"links":{"cited_paper":"/paper/2502.16282","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:addcb25fc2d53e6007a5cb5f5ec71074648fc22ebf9ff540cc5424794d49c403","observation_id":"0b11eb7f-38f9-4e8d-b97d-0ccb776346f8","resolution":{"observed_at":"2026-08-03T18:43:47.010177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.081888Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.081888Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:63a1cf51bb1eff0abd39fa895a55f1bf8f8eb3bb44ed06bf774c13a59faf3e53","observation_id":"0e52d83a-1086-45c3-b0df-5b534970b4af","resolution":{"observed_at":"2026-08-03T18:43:47.081888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.183623Z","title":"EPIC Fields: Marrying 3D Geometry and Video Understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.183623Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:d17e5d8b9c2d18ea6acc0f22253b48a29d82899e306aa31ad29494dd480eabc9","observation_id":"c5e628e1-be0c-4f0c-a354-902f0db8c435","resolution":{"observed_at":"2026-08-03T18:43:47.183623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.284316Z","title":"Is ImageNet worth 1 video? learning strong image encoders from 1 long unlabelled video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.284316Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:160c12670f2ed042fb24bdab6886fc36e31352414e94063d0c6cbc8b4c4cb141","observation_id":"817f61fe-51af-4f6a-a3f0-523fcf6943d3","resolution":{"observed_at":"2026-08-03T18:43:47.284316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.392070Z","title":"Dust3r: Geometric 3d vi- sion made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.392070Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:ee953eb6e603975c3c8de44e8dd6cb97ef20c21a6775fdaa63712ce88a7b2e60","observation_id":"bbfff031-e699-440d-b3bc-d430ca9de95a","resolution":{"observed_at":"2026-08-03T18:43:47.392070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.502142Z","title":"Croco: Self-supervised pre-training for 3d vision tasks by cross-view completion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.502142Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:ef3b5f2a4cdeb4e59cfb81dd8569103ac31ba7c5d910dc08637b1ad2a98dbd0a","observation_id":"9cf923c1-1fdc-4664-88aa-b1c28fdb196f","resolution":{"observed_at":"2026-08-03T18:43:47.502142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.816440Z","title":"Croco v2: Improved cross-view completion pre- training for stereo matching and optical flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.816440Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:874f63edb51a31a6952e7616dc2bfb93d9a1b9212df900b8d443e11682e30382","observation_id":"85cca23e-31a8-471d-99d5-4b3d2084baf9","resolution":{"observed_at":"2026-08-03T18:43:47.816440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-03T18:43:47.983776Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.983776Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:07ea8806a9af4952ac3c2503d78ac75fdab3033d605ce6112e3eea51f9be2923","observation_id":"855413cd-ec50-497a-88fb-fff89b001534","resolution":{"observed_at":"2026-08-03T18:43:47.983776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:48.086198Z","title":"Learn- ing streaming video representation via multitask training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:48.086198Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:a85502261f376092e02de1cae1abfb125909dcc8f1580707d5afa11364a0a776","observation_id":"c2c01370-3153-4360-8b3e-1089b2725883","resolution":{"observed_at":"2026-08-03T18:43:48.086198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:48.192255Z","title":"Depth any- thing v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:48.192255Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:0207d861e652b6ac39e1a8f55319939228d9d2acca154e27279d33b31845aa2b","observation_id":"1352ab2b-c073-46fb-a9c9-eeedcc706f86","resolution":{"observed_at":"2026-08-03T18:43:48.192255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:48.317953Z","title":"Assess- ing and learning alignment of unimodal vision and language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:48.317953Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:2fe1baca88d79480cec09c6c207b022d5663d95d698cf663df1a89a7616ef15d","observation_id":"ab289efd-c97a-4002-877b-3310a670425d","resolution":{"observed_at":"2026-08-03T18:43:48.317953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:48.452812Z","title":"non-life","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:48.452812Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:0aba2c530c8d612155981527c95fbd6cb4207203b6ca0aa5f97739358bd2be14","observation_id":"a6f744ba-c303-405e-9799-401841590eb2","resolution":{"observed_at":"2026-08-03T18:43:48.452812Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:47.657177Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:47.657177Z"},"links":{"citing_paper":"/paper/2512.04085"},"observation_digest":"sha256:81106a31c3f7fc77f2128d1d9e89542907137ec75d9cf1075795d734c281305f","observation_id":"c2c61063-88b5-44b0-b7bc-f8132d54fea1","resolution":{"observed_at":"2026-08-03T18:43:47.657177Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T18:43:41.712073Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2512.04085."}