{"as_of":"2026-08-17T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75d52bf8dc83e7a27b33eac9a2f867535e8510a449596bceb87f81112ca2c7ad","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:02:14.488862Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03005/citation-record","integrity":"/paper/2501.03005/integrity","json":"/paper/2501.03005/citation-record.json","paper":"/paper/2501.03005"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.01499","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.833791Z","title":"Assran, Q","venue":null,"work_id":"6b56a264-fb64-47b8-8119-275c5b46e378","year":2023},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.392369Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:5c7ffc9b975efc88e6d4c17b59e0c51febef8f2c4af5526cdee1506ecd37bd37","observation_id":"83549198-8119-4e0a-abac-dbd258ebaeaa","resolution":{"observed_at":"2026-08-10T22:02:14.840785Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.959725Z","title":"Baevski, W","venue":null,"work_id":"740330a0-a69e-4d15-804a-35d8cc23c352","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.396551Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:61d4861c4b23c9c7fa713c8ba51aec73ba3e295cc3a3611b9d739e8eaafdd0bd","observation_id":"900b4b94-3f98-41c3-a473-967e6b9ef316","resolution":{"observed_at":"2026-08-10T22:02:14.963403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.948901Z","title":null,"venue":null,"work_id":"02a1d8b4-f7da-4d98-ab51-52fc8f44dc6f","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.400415Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:de2b251da16cc3156af82bb681b61a76976987dbde055d76d7acba7d52b681fd","observation_id":"6e3f718b-8500-4da9-8de4-466b243e69f6","resolution":{"observed_at":"2026-08-10T22:02:14.952371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.938536Z","title":"Caron, H","venue":null,"work_id":"2306bda3-cfe1-4f0d-96dc-afcb2781c32e","year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.404394Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:6b996eb0ca70061cc558e8e9c5d82587e284ed4fd120ee25ee6c63f9147d891c","observation_id":"9ad125df-8860-4e6d-960d-e5991165e1d6","resolution":{"observed_at":"2026-08-10T22:02:14.942122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03026","last_updated":"2023-08-10T11:01:14Z","snapshot_observed_at":"2026-08-16T17:23:11.785033Z","submitted_at":"2022-02-07T09:33:45Z","title":"Context Autoencoder for Self-Supervised Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03026","snapshot_observed_at":"2026-08-10T22:02:14.411704Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.411704Z"},"links":{"cited_paper":"/paper/2202.03026","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:05eb9f9e377c41dabc9098ebec348ef67ef547b1ad2fc06c9a06fc8910750b04","observation_id":"3455d2a0-20bf-4fc7-84e5-f756fab256d6","resolution":{"observed_at":"2026-08-10T22:02:14.411704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.928489Z","title":null,"venue":null,"work_id":"4ee08e1b-058a-4f1c-a89b-60bf96d94558","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.415961Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:e8f5c704d32ad9a17ff2bd34ac1ebbb357241ed473ed9ee798a4ff003a181944","observation_id":"64f8a781-55d2-4a7f-8b4f-84c5d24b13d7","resolution":{"observed_at":"2026-08-10T22:02:14.931995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.918211Z","title":"Dosovitskiy, L","venue":null,"work_id":"acffe7d0-f0bc-42a7-bf27-f156eeb258c0","year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.419799Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:446611d6334bd2debfd4569c502549877f682964533ed80cb18ba54adf487166","observation_id":"c738b8e9-73e4-4d01-9093-e859b11ae957","resolution":{"observed_at":"2026-08-10T22:02:14.921687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03892","last_updated":"2022-05-19T16:28:37Z","snapshot_observed_at":"2026-08-16T17:01:48.716400Z","submitted_at":"2022-05-08T15:12:19Z","title":"ConvMAE: Masked Convolution Meets Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03892","snapshot_observed_at":"2026-08-10T22:02:14.423243Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.423243Z"},"links":{"cited_paper":"/paper/2205.03892","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:d1920d56fdb6f91927efb1db7e3cef4af41b7a6d02448a5df1bca6f451e874bd","observation_id":"2d5d574d-b178-4bd9-99bf-22b199494f06","resolution":{"observed_at":"2026-08-10T22:02:14.423243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.907653Z","title":"Garrido, R","venue":null,"work_id":"287c0f50-2ef1-4ed3-8b2d-02fa25482968","year":2023},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.427531Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:5d8017d303bec5f26e59c4a41c3b4118bbda285371083d7f4434f7e9b4278dac","observation_id":"1a1e3e74-195b-4c78-8d0c-c611d32683a8","resolution":{"observed_at":"2026-08-10T22:02:14.911140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.434735Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.434735Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:0d8aa25d2ac00345ed4a2747c2408023a350793c56474b4c530657f7126b5bc0","observation_id":"29574cbb-8d17-45f8-995d-1c94588474c2","resolution":{"observed_at":"2026-08-10T22:02:14.434735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.438544Z","title":"Johnson, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.438544Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:1dbb7314bf1626022115332049a654481629508d4fea90ed29248894611f66ee","observation_id":"4c534ad5-e2dd-4449-baad-e91a7ca24efb","resolution":{"observed_at":"2026-08-10T22:02:14.438544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.443266Z","title":"Krizhevsky, G","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.443266Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:888f3ded67a88f711426147c98e664dbba6ef99b4df5787f37c07110ad6c8c8d","observation_id":"c67b97bb-197b-49dc-94b5-033995d88618","resolution":{"observed_at":"2026-08-10T22:02:14.443266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.891353Z","title":null,"venue":null,"work_id":"195ae59d-6e3b-4a32-9e3b-22097a3c3c04","year":2024},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.447505Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:6f6de7555e9fcd19cf4c8887ab407d930d527b65e79cee7ca5ffbcc44fafdfe6","observation_id":"de156172-0c93-4fb1-8b67-13a8c8023aaa","resolution":{"observed_at":"2026-08-10T22:02:14.894971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.451528Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.451528Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:fbf18fbb780bc259ee8f6f0c96d12f86d78bcff806d2e74c85e25cd2f0469505","observation_id":"de866086-cf1f-48fd-ad99-c27a85b0482c","resolution":{"observed_at":"2026-08-10T22:02:14.451528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-16T16:39:31.250386Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-10T22:02:14.455087Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.455087Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:630eb8c8aa4d2926cd39395108a1ea67695c685a2bc9e147d6c141725878ab68","observation_id":"5d8ecc27-ac2e-44d0-8bd7-674830c933ee","resolution":{"observed_at":"2026-08-10T22:02:14.455087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.459603Z","title":"Russakovsky, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.459603Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:37589ba46c0d30c85c2326f7d1fe20416b3110fd00e541b321c42283b38a7854","observation_id":"ca43ae86-7477-47e7-a85b-82bba5f1ce4e","resolution":{"observed_at":"2026-08-10T22:02:14.459603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.875356Z","title":null,"venue":null,"work_id":"0ba7dfc8-0e23-403b-96fc-bd64c57cb5e5","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.463405Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:4f665c0b132600a715859bb6a1d9fb80467dffaa41e1ee900491d5bff062972e","observation_id":"46d684a6-0d0f-44f7-9545-42c514da374d","resolution":{"observed_at":"2026-08-10T22:02:14.878865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.466900Z","title":"Van der Maaten and G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.466900Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:158559a96b0d5eba3ed71d96c38f285cf7956ef22f3961b2976ad5a09760895a","observation_id":"327d3105-8b3f-49ff-8ea7-280ce5aa7ca5","resolution":{"observed_at":"2026-08-10T22:02:14.466900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15837","last_updated":"2024-07-22T17:54:41Z","snapshot_observed_at":"2026-08-16T15:17:21.036689Z","submitted_at":"2024-07-22T17:54:41Z","title":"Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15837","snapshot_observed_at":"2026-08-10T22:02:14.473655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.473655Z"},"links":{"cited_paper":"/paper/2407.15837","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:28f8da41c1374cb106d2172de3548e796f3d2b337a75e476859285f55d44c808","observation_id":"d85a0800-68cc-41b1-a642-0d38a3609505","resolution":{"observed_at":"2026-08-10T22:02:14.473655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.477448Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.477448Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:0bd3aea5853403d2261aeef63aa4e0c20237ec8b2bbf2255bd6ae94ac0643e40","observation_id":"d94b1ec1-9736-4b4c-bf07-647369ac4494","resolution":{"observed_at":"2026-08-10T22:02:14.477448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-10T22:02:14.480687Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.480687Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:c3e8af181b783620af627b266eece2f6de7bc44b666648f91d0c273fd44f2a69","observation_id":"dc3d168b-79cc-461d-bffd-b0dd15b12f71","resolution":{"observed_at":"2026-08-10T22:02:14.480687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.858515Z","title":null,"venue":null,"work_id":"6e689fb0-fe9e-4ab2-82c1-9c4d200fb5ca","year":2014},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.484389Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:f3cb3d5201216ace841e17ada1ac8bb17939d8d1927521c7cc3d2554e1e5777c","observation_id":"808799ee-7a1b-4ab6-8fa2-0f19fe33ee2d","resolution":{"observed_at":"2026-08-10T22:02:14.861934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.847946Z","title":null,"venue":null,"work_id":"0684ebda-2c09-4cc3-b118-53b00f9cf5d2","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.488862Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:9aa523c1cb660d02ca6083500f53b48c9966a819cd289610b161a6cd2edd27e0","observation_id":"9a16a01e-ba0c-48a2-8b18-325906609a5b","resolution":{"observed_at":"2026-08-10T22:02:14.851704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.408238Z","title":"doi: 10.1109/ICCV48922.2021.00951","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":9640,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.408238Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:5b65bdf3e079ba9f0749bc898c57b89ee558d1b542a98f7700c9f9e33204a818","observation_id":"2045cf14-f635-4683-b08c-e33694d517f4","resolution":{"observed_at":"2026-08-10T22:02:14.408238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T01:22:34.922657Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2501.03005."}