{"as_of":"2026-08-09T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1a128b860d5132515b594c217d84c717003985961f587c22bb9678f335da251","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:30.453824Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14373/citation-record","integrity":"/paper/2506.14373/integrity","json":"/paper/2506.14373/citation-record.json","paper":"/paper/2506.14373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.185465Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.185465Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:b64587d1fa18d656e338ca286126c91011fc377b32fce993d18e0446ed0e3b88","observation_id":"9fc82712-be8b-4279-882b-ae724a91b7c6","resolution":{"observed_at":"2026-08-07T00:24:26.185465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.237674Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.237674Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:513ce3d8bff399ddb6dbb004b4bc8403805ea6b45bd7593f0e6537f575e05ef5","observation_id":"e57ea957-88f9-4c9f-90af-de864697285b","resolution":{"observed_at":"2026-08-07T00:24:26.237674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13967","last_updated":"2025-06-04T12:56:23Z","snapshot_observed_at":"2026-08-07T18:04:12.028140Z","submitted_at":"2025-02-19T18:59:44Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13967","snapshot_observed_at":"2026-08-07T00:24:26.329146Z","title":"F., Amirloo, E., El-Nouby, A., Zamir, A., and Dehghan, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.329146Z"},"links":{"cited_paper":"/paper/2502.13967","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:839ea88de1b67ae7e483d127f5508593da54f61fed1c87542b007c534bead8c6","observation_id":"ee908e99-44c8-463c-bd17-ecc8f4bba974","resolution":{"observed_at":"2026-08-07T00:24:26.329146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:34.003325Z","title":"Dreamweaver: Learning compositional world models from pixels","venue":null,"work_id":"ce314d6d-4169-482e-be90-3f62d6ca3dc5","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.427819Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:cf6bfcbc22e5102725a04f0980654f1f2f51e5201b31261517a82111748c0e3e","observation_id":"95fbd1b8-7cac-4aa6-bbf3-2814406a9c7b","resolution":{"observed_at":"2026-08-07T00:24:34.007479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.992374Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":"402dfd02-2311-4cfe-a9ca-fdb83cc0dabf","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.492154Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:5804d7d2d6dd949844976275dcb075bec51c08e2e8dfbc2a1cfce6adc75aa530","observation_id":"7069b2c3-693c-47ea-b1fe-ec4da229b72d","resolution":{"observed_at":"2026-08-07T00:24:33.995855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-07T00:24:26.555325Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.555325Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:dff32323d2de50047abccadcbd5833d1ad2bae258e68b37ba88db64e1c37306c","observation_id":"7da386d6-421f-44c2-9941-79ad399fe2b2","resolution":{"observed_at":"2026-08-07T00:24:26.555325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04906","last_updated":"2022-01-28T12:23:37Z","snapshot_observed_at":"2026-07-06T11:08:17.373935Z","submitted_at":"2021-05-11T09:53:21Z","title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04906","snapshot_observed_at":"2026-08-07T00:24:26.691304Z","title":"Vicreg: Variance-invariance-covariance regularization for self-supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.691304Z"},"links":{"cited_paper":"/paper/2105.04906","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:8bc2d7b894690ebb26c3b439bd59b06f45c9838eb7bcbea6b7c6483d7d827270","observation_id":"0f02d643-addc-4fe4-a12b-dd2f54dd7d74","resolution":{"observed_at":"2026-08-07T00:24:26.691304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.982212Z","title":"V-jepa: Latent video prediction for visual representation learning","venue":null,"work_id":"821e102b-5217-4c2d-a027-6fc0f14bda30","year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.798973Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:2f1037c97113d3e996b3fca864dd72773f4ac2a8f964a2e149e1cd17904a33d2","observation_id":"973f931b-ce4b-44e8-96b0-3e4cec9f4f07","resolution":{"observed_at":"2026-08-07T00:24:33.985764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12698","last_updated":"2023-07-24T11:27:14Z","snapshot_observed_at":"2026-08-09T19:54:06.046064Z","submitted_at":"2023-07-24T11:27:14Z","title":"MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12698","snapshot_observed_at":"2026-08-07T00:24:26.878798Z","title":"Mc-jepa: A joint-embedding predictive architecture for self-supervised learning of motion and content features","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.878798Z"},"links":{"cited_paper":"/paper/2307.12698","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:64ea7795fa3997e4756f79e834b0c4aa7137f41584eadde59c9dec936e1d8b46","observation_id":"5448e556-3d81-4967-9691-4fb64c98e64b","resolution":{"observed_at":"2026-08-07T00:24:26.878798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.971423Z","title":null,"venue":null,"work_id":"7e9ba97b-bfcd-4a53-9d27-40c9ee73f519","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.960544Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:6a71256eb8d142b52efc998cf5b8a5f986ad06eff539a7cb29740910612299af","observation_id":"732a1c8b-1897-45ab-9cbc-572725cad9f4","resolution":{"observed_at":"2026-08-07T00:24:33.975553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.087183Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.087183Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d385af616668fc32c3160fc5a5e6ae306335d7d4342af748572543c9548da1dd","observation_id":"e1dd3558-7b46-4bd9-982c-4cc91e50f13a","resolution":{"observed_at":"2026-08-07T00:24:27.087183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.227869Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.227869Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:b1240eeb9554a647850937bdd32bb24c51c741aba85612e2379b73c7952f0409","observation_id":"7871b9f2-5379-45c5-a868-9ce7ff8dab8e","resolution":{"observed_at":"2026-08-07T00:24:27.227869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.320134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.320134Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:c3fbd8b2bf2cce19e364c8fddddd6a3fd95633b41350e2df370fe9cda1f8e400","observation_id":"869ce1de-05c7-4f86-bb31-c3b5621ecd39","resolution":{"observed_at":"2026-08-07T00:24:27.320134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.937938Z","title":"Denoising with a joint-embedding predictive architecture","venue":null,"work_id":"f5a16452-dddd-49f6-be74-c09f0e83104b","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.393067Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:6596fe461de9a2b28684310d74a3a647dcda17e92c46361de51bfe6ffb2f64c3","observation_id":"970ba5bc-d4f8-44dc-8a9d-57e95e897a62","resolution":{"observed_at":"2026-08-07T00:24:33.941909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.883119Z","title":"Masked autoencoders are effective tokenizers for diffusion models","venue":null,"work_id":"57050fa5-a9bc-4583-bdcc-8b2bef492c87","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.478920Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:4c2459a2e6d67c38f514527fa14f5bde50131c4cd9888bdcb59718aa9cf62d82","observation_id":"814a123c-9385-4331-9f15-c49a022cb99b","resolution":{"observed_at":"2026-08-07T00:24:33.929950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.671057Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"88e148ee-8f2d-47c9-abb6-4a479604e7ae","year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.572690Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d21655babebe29d62785f0424180deec9f45e90b3f09ba44b8ed6b25620f2576","observation_id":"4e342daa-260c-44e9-9c32-6d3b377521d8","resolution":{"observed_at":"2026-08-07T00:24:33.775735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:24:27.663546Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.663546Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:38d23e8a54313d48517247c7317277344939387efea9512a09f0f01962739229","observation_id":"797b6d33-8203-47ad-99bc-4d375504ee93","resolution":{"observed_at":"2026-08-07T00:24:27.663546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.763668Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.763668Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:66ae200fd2d988ff38880ff9343dcf54905b26ebbb8e92f783d78c23b6f595f1","observation_id":"fda9560b-0e31-4ed5-b0ed-f4de325c639f","resolution":{"observed_at":"2026-08-07T00:24:27.763668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.376936Z","title":null,"venue":null,"work_id":"2a16e2ad-b1ce-4bc9-b0d6-61d7c72ab41b","year":2013},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.839664Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d2a44d0ae909ed3181c6140a74ebfe9e35e3594750942fca2c5ce7d3140ba76c","observation_id":"b0cc2f58-a326-43cd-b30e-84fecd860496","resolution":{"observed_at":"2026-08-07T00:24:33.508791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15830","last_updated":"2024-01-11T13:16:43Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T13:53:53Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15830","snapshot_observed_at":"2026-08-07T00:24:27.926611Z","title":"A-jepa: Joint-embedding predictive architecture can listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.926611Z"},"links":{"cited_paper":"/paper/2311.15830","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:2641a6c84495836e30a02eb143e1da73a61a23737fb488d4df9442fc6c728777","observation_id":"00540c91-095e-4b7b-8827-d9f08fba4a75","resolution":{"observed_at":"2026-08-07T00:24:27.926611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.154895Z","title":"R., Blundell, C., Beaudoin, P., Heess, N., Mozer, M","venue":null,"work_id":"8d444864-ad13-44cc-9afd-5e351ebe3ccd","year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.970122Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:04a515b9565267065657186cdf456a1a79e3a884ac7874a743ff475be78c68d4","observation_id":"3bc71edd-e1c8-48cf-bdca-f54608716322","resolution":{"observed_at":"2026-08-07T00:24:33.285288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.070454Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.070454Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:03317fe1ff07aead51900a246f3b37176c4067db6d02d80f0bfa56824b7fcd3e","observation_id":"08e4475c-0384-4af4-86e4-73dbf9a9e974","resolution":{"observed_at":"2026-08-07T00:24:28.070454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.143370Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.143370Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:9b09e6cbf61efbf13f5b328ca47bafa2df1dc8b2633f05bb09c9c8d93d0ec625","observation_id":"61cec8d4-1ce4-48d4-9469-a914b6f753d0","resolution":{"observed_at":"2026-08-07T00:24:28.143370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.856012Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"d9a23cad-b16c-46df-b361-b65cfa3aca00","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.250270Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a6bfc887cb96dfce1dcb6608c502419b05d653a3c4a24ce1b76eddd1e730e520","observation_id":"d2ba66fa-fa82-4785-9768-6d26e32b2d41","resolution":{"observed_at":"2026-08-07T00:24:33.018490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.586981Z","title":"Slot state space models","venue":null,"work_id":"e5eef4dd-8235-4268-bb5b-eadcbe91013b","year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.401167Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:90b46f7ebfbd2df079a1c61e9dfb9bc9e13211265ad357be21b59e6aa7a27b85","observation_id":"9a676a67-ffc9-485f-b242-4b3ccf2bb6bd","resolution":{"observed_at":"2026-08-07T00:24:32.692226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.355348Z","title":"Thinking, fast and slow","venue":null,"work_id":"e6991340-8bf2-439a-8cbc-905c7a0d5fde","year":2011},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.499285Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:6c12a9f6f184caeaf577179706ec96b2b1981cff3e23de8ffb5ebc6e43f231bf","observation_id":"2f9dff62-4992-4dc3-9889-0edbf6ebcdec","resolution":{"observed_at":"2026-08-07T00:24:32.465421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07730","last_updated":"2025-08-02T07:11:16Z","snapshot_observed_at":"2026-07-06T20:20:37.632750Z","submitted_at":"2025-01-13T22:37:17Z","title":"Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07730","snapshot_observed_at":"2026-08-07T00:24:28.604884Z","title":"Democratizing text-to-image masked generative models with compact text-aware one-dimensional tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.604884Z"},"links":{"cited_paper":"/paper/2501.07730","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:05a51a9effdcff6e8c6f04b0faefa11fb7a59a91f5fba0074b4cc541fd31bc8f","observation_id":"e68e0ac9-b8b6-4158-bd8f-a754fcb4aa74","resolution":{"observed_at":"2026-08-07T00:24:28.604884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.043022Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":"909e842a-2cb6-4cbe-ad29-482459ca0d04","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.762881Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d32789e9e859a52743473643bd16b53a447dbb18c6d004260d4936f4321e97d9","observation_id":"3d73cb7f-299a-4e5b-b4d4-db1229f2358a","resolution":{"observed_at":"2026-08-07T00:24:32.146526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.903717Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"d4ca2ca4-1613-4d2f-a47a-9e6e954ecd1e","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.874789Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:4889ff66892c66f0ab42caf8afbe709f9dc00b238c50270780a5005b33017dc5","observation_id":"7e781f09-f75a-472e-a28a-00edc0b4d445","resolution":{"observed_at":"2026-08-07T00:24:31.956028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T00:24:28.960511Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.960511Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:74705ebac6b6eef6620c9beb353ba7c07d5c8dae3eb154803fe4445a63abed2c","observation_id":"8ccd5c0d-d428-4790-84e5-a70538717b2c","resolution":{"observed_at":"2026-08-07T00:24:28.960511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.674806Z","title":null,"venue":null,"work_id":"16c0becf-f8de-4232-9f67-5fa18157ace9","year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.045870Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f1bf9ee3062d2a4d1a5c5cb0428ee433895e0af9a7dfde70053077f4f7757bb9","observation_id":"41008482-6f2f-4304-af53-592caea5d1ff","resolution":{"observed_at":"2026-08-07T00:24:31.757430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.536578Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"6b0582a9-5d12-4b7c-a810-61677956efd0","year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.146927Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:e752aa969d379483fd7695781ab2c6a9c94dd9c44f691e3f0798b0f56e16d0aa","observation_id":"5e3d6c9e-7bc1-4190-a1e8-d1af6e3499a7","resolution":{"observed_at":"2026-08-07T00:24:31.604603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.248985Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.248985Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:5518eb6a370259172898c845172f4e44e0d7d6359bf87ac7499c2a93c855f0ce","observation_id":"55338ea2-0bd6-481b-b711-77c34cfd078d","resolution":{"observed_at":"2026-08-07T00:24:29.248985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12690","last_updated":"2024-05-10T09:54:46Z","snapshot_observed_at":"2026-07-31T03:18:29.810462Z","submitted_at":"2023-10-19T12:38:09Z","title":"Neurosymbolic Grounding for Compositional World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12690","snapshot_observed_at":"2026-08-07T00:24:29.359281Z","title":"J., and Chaudhuri, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.359281Z"},"links":{"cited_paper":"/paper/2310.12690","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:7edfe3818c2a355cb48d813f99f6685fa79afe2a5d974b957fba1b850f524bf5","observation_id":"8b01dca9-4494-4488-be5c-3f2f370f5fb1","resolution":{"observed_at":"2026-08-07T00:24:29.359281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10831","last_updated":"2022-11-20T00:50:11Z","snapshot_observed_at":"2026-07-06T14:20:42.913149Z","submitted_at":"2022-11-20T00:50:11Z","title":"Joint Embedding Predictive Architectures Focus on Slow Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10831","snapshot_observed_at":"2026-08-07T00:24:29.442876Z","title":"Joint embedding predictive architectures focus on slow features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.442876Z"},"links":{"cited_paper":"/paper/2211.10831","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:3cd6b2761c29fbb65e7dc00e3cab26121f03db58b63b0544581c651b90cc9c83","observation_id":"843b2738-6ce8-4e95-a3f8-14f69bb196db","resolution":{"observed_at":"2026-08-07T00:24:29.442876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07547","last_updated":"2022-06-09T12:46:05Z","snapshot_observed_at":"2026-07-06T13:10:16.795009Z","submitted_at":"2022-05-16T09:49:37Z","title":"SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07547","snapshot_observed_at":"2026-08-07T00:24:29.539556Z","title":"Sq-vae: Variational bayes on discrete representation with self-annealed stochastic quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.539556Z"},"links":{"cited_paper":"/paper/2205.07547","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:16c87acfe53477ade22beb0d6af1849eb049120b613b1f4221f75f4e233eaa8d","observation_id":"e2880a72-e37b-453e-a927-c5c302388e09","resolution":{"observed_at":"2026-08-07T00:24:29.539556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.651416Z","title":"Worldcoder, a model-based llm agent: Building world models by writing code and interacting with the environment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.651416Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:7f9130c07fdc49b197b0300afac8b41dad9ae78c4a0f7bebfa659e55c27e76ad","observation_id":"d6f5fe50-fa18-43c0-be2a-d29adcd1bdf7","resolution":{"observed_at":"2026-08-07T00:24:29.651416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.380567Z","title":"and Levy, M","venue":null,"work_id":"0bb97900-baf8-4878-ac92-f3b6e3ce6d22","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.724101Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:1b524b589a0e723d6b101603d25b1c01ed00a0f1796e71ce51c7962e6c052abb","observation_id":"afa3f788-8206-42af-8017-d1fabb6caf6a","resolution":{"observed_at":"2026-08-07T00:24:31.447266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.801294Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.801294Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:10a183b8b873345aee30c05ef64b442add26a37c7d4ff0cb3d3e35207e30230c","observation_id":"4ed3b26e-65ec-436d-b75f-b7ea70d3e500","resolution":{"observed_at":"2026-08-07T00:24:29.801294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.178299Z","title":"LARP : Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":"97da56fa-d4cb-4f82-aa72-d830e144120c","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.878149Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:bbdb9c3f09d9ff51505ebb87fa5ea9350eccc3b4fae1baaa159215d73acedd69","observation_id":"39fa1c7b-eed5-45d6-a9c7-6f4389ea56c5","resolution":{"observed_at":"2026-08-07T00:24:31.292857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.996968Z","title":"Spriteworld: A flexible, configurable reinforcement learning environment","venue":null,"work_id":"aa377a6e-f2f3-4759-baeb-9144743a6520","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.947822Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:48a7c1c851582d7549217ba10bc60040cda5945702930d8154ab4603a9b4b494","observation_id":"dee467ee-a23f-4e91-85af-fc2a84316696","resolution":{"observed_at":"2026-08-07T00:24:31.074167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05127","last_updated":"2025-02-26T02:55:53Z","snapshot_observed_at":"2026-08-06T09:50:19.009159Z","submitted_at":"2024-06-07T17:55:43Z","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05127","snapshot_observed_at":"2026-08-07T00:24:30.005895Z","title":"Towards semantic equivalence of tokenization in multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.005895Z"},"links":{"cited_paper":"/paper/2406.05127","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:58fd08fd9e5d4479ef7610051f42d51fe0ca349cce5c6dad6d679cb20a101538","observation_id":"4af2eb45-a61b-43b3-89fb-ba0ebb81fea4","resolution":{"observed_at":"2026-08-07T00:24:30.005895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.096531Z","title":"Temporally consistent transformers for video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.096531Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:ffa92853d9b297d1171c1c7ce55e13644cfef20b3f537b5578e6bcdeb5d6fd55","observation_id":"a426e9c4-71c3-4afb-a169-693f1fa86fb5","resolution":{"observed_at":"2026-08-07T00:24:30.096531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T00:24:30.154979Z","title":"Y., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y., Baldridge, J., and Wu, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.154979Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a2e3841671f22d4424e1f9e757166986296b901f894405736ef51c3b6fa9767c","observation_id":"c4b8d77e-2d40-4634-9e99-c9e758dae6fd","resolution":{"observed_at":"2026-08-07T00:24:30.154979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.839826Z","title":"G., Yang, M.-H., Hao, Y., Essa, I., et al","venue":null,"work_id":"0631ef23-f3d5-414c-920f-5ea7e293138e","year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.250765Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:be852f805ad2f78b848aa13f0f5e1cb49633c0ae4a726e122c1ec5e65ae3f293","observation_id":"ffb2c71a-d367-46f6-976a-014c9fc63ce1","resolution":{"observed_at":"2026-08-07T00:24:30.921708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.337622Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.337622Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:2bf63a380568183a31f8c603cd38b605e0dc6f0eb0eabf32576360b12a978bfc","observation_id":"314029b8-d81a-4696-bd4a-124ff8757640","resolution":{"observed_at":"2026-08-07T00:24:30.337622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.676689Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"acee7c8d-18f6-41da-878a-4d9703d718df","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.453824Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:563a324fe601a34a680b8b92cb7c27e361cf526058787a131f41d692f343840e","observation_id":"5c8ddd92-360a-4c9e-9e87-a5c79cc23ca0","resolution":{"observed_at":"2026-08-07T00:24:30.751457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:22:32.413515Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.14373."}