{"as_of":"2026-08-10T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:038c6137e70380fe2069e24121b87f9c82ea3c8215435c743c6fadc2941bf620","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:54.714314Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T15:43:53.781661Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-08-06T18:32:54.714314Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation.arXiv preprint arXiv:2501.09755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.714314Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7c8788d5a36ccc62c67aa27caf046a92e54e1e424b7ffea2df9fcbad8d66acc5","observation_id":"09dadb60-9087-4483-9174-0060d7155eec","resolution":{"observed_at":"2026-08-06T18:32:54.714314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2509.18611","last_updated":"2026-04-20T01:36:57Z","snapshot_observed_at":"2026-08-09T07:55:36.141528Z","submitted_at":"2025-09-23T04:00:41Z","title":"Flow marching for a generative PDE foundation model","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-18T13:48:14.532529Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2509.18611"},"observation_digest":"sha256:6f4c51779868a7f86f551f5bc83448b946d29fb31adce418e48bc5f732cb3fc3","observation_id":"a76ca4bf-c885-4701-ab4f-dcb157ef389b","resolution":{"observed_at":"2026-05-18T13:51:25.457933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2604.07340","last_updated":"2026-04-08T17:53:52Z","snapshot_observed_at":"2026-08-02T15:43:17.100110Z","submitted_at":"2026-04-08T17:53:52Z","title":"TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:44:14.636654Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2604.07340"},"observation_digest":"sha256:8e8e0b17a078ea046d713011de1711d17b3e2cde1a34c401fc57516f27048703","observation_id":"2aa396cf-8da4-4bbc-b54a-8e497bd7139a","resolution":{"observed_at":"2026-05-11T06:15:57.138473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:b8208dab69ce56990fb0efa7ee250c862d14fc25cf580368fc242ee27e4704d4","observation_id":"ac0c1624-78af-40ce-9719-35b212adf4b2","resolution":{"observed_at":"2026-05-11T10:41:03.077326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.05331","last_updated":"2026-05-06T18:03:13Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:03:13Z","title":"ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T17:06:21.438738Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.05331"},"observation_digest":"sha256:9dea2a6eafb3a938c8b5ce5a6f98b1448afcb6845208908bcb7a15d6d48c8682","observation_id":"b0ace6f3-d26d-4699-b281-320374b491fa","resolution":{"observed_at":"2026-05-11T17:51:06.445578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.06628","last_updated":"2026-05-07T17:42:38Z","snapshot_observed_at":"2026-08-03T09:06:35.068354Z","submitted_at":"2026-05-07T17:42:38Z","title":"LiVeAction: a Lightweight, Versatile, and Asymmetric Neural Codec Design for Real-time Operation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:42:56.202960Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.06628"},"observation_digest":"sha256:135391dbdc922e457b02cdafd0a99a54919fba93b5a94826d12bf84189fd800b","observation_id":"d0055b1f-9d88-459b-bc31-c64cb3afe703","resolution":{"observed_at":"2026-05-11T21:56:30.898606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.07915","last_updated":"2026-05-08T15:52:51Z","snapshot_observed_at":"2026-08-02T05:37:32.685801Z","submitted_at":"2026-05-08T15:52:51Z","title":"What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:24.033068Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.07915"},"observation_digest":"sha256:c7b23303d3001cf72253afb4dcda04e1673b1a974cd712612d15e7570d42c74e","observation_id":"7e29255c-bf86-4f97-9053-82a549e05319","resolution":{"observed_at":"2026-05-11T04:05:57.333354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.09981","last_updated":"2026-05-11T04:49:47Z","snapshot_observed_at":"2026-08-03T14:27:49.163957Z","submitted_at":"2026-05-11T04:49:47Z","title":"Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:05.492969Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.09981"},"observation_digest":"sha256:3886867749c0930d6f97aa5a628e59d71563b630efb2e27526baf91aa12d1485","observation_id":"3dbd517c-af80-47d7-b9be-5335072a6892","resolution":{"observed_at":"2026-05-12T06:46:29.699689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:5b92bbc0f1ff923edbb524ad6cba54a92a0a77db1c8e954bad86e6bcfc48becf","observation_id":"a0bbab4b-173f-4e72-9dca-99de3929f7dc","resolution":{"observed_at":"2026-05-20T11:03:13.439682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2606.05552","last_updated":"2026-06-04T01:06:52Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:06:52Z","title":"Balancing Image Compression and Generation with Bootstrapped Tokenization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:33.054518Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2606.05552"},"observation_digest":"sha256:30fe37f03f67dbc23785f4b728b5ed2d1b38e1e972700dceae17b51d7ef04e13","observation_id":"51798922-a3bf-4a4f-9b45-9dd38f20c13a","resolution":{"observed_at":"2026-07-02T11:46:55.456464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2607.05352","last_updated":"2026-07-06T17:31:52Z","snapshot_observed_at":"2026-08-05T02:41:56.861095Z","submitted_at":"2026-07-06T17:31:52Z","title":"Multiplayer Interactive World Models with Representation Autoencoders","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-07T15:38:36.897705Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2607.05352"},"observation_digest":"sha256:f73c71294271a7e48628f9cbaedc14c57397aa7ffbc0b78c21ded6b5498000a2","observation_id":"c02e9aa8-1cbf-473b-a748-2a9cb2180d83","resolution":{"observed_at":"2026-07-07T15:43:53.783116Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09755/citation-record","integrity":"/paper/2501.09755/integrity","json":"/paper/2501.09755/citation-record.json","paper":"/paper/2501.09755"},"outbound":[],"paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2501.09755."}