{"as_of":"2026-08-18T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8c5816fc745c6b6704f587e616ebd8a8903887078c34339ef49e4aec96a28d6","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:28:17.123060Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08832/citation-record","integrity":"/paper/2608.08832/integrity","json":"/paper/2608.08832/citation-record.json","paper":"/paper/2608.08832"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:16.834104Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.834104Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:980e56971d5eba46ffcfffc1ecf07171039c0534084d18599b67bc8f320a4f35","observation_id":"21627b4f-3927-41b5-9214-74ad654f6b7b","resolution":{"observed_at":"2026-08-14T04:28:16.834104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-14T04:28:16.839108Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.839108Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:3c33ac0b1ecf7727222b22daeff6a43b39a72d105bfa8275c53818186edade43","observation_id":"9dbc080d-cd63-4e17-8f0d-05eb4ce0b1a0","resolution":{"observed_at":"2026-08-14T04:28:16.839108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:28:16.843829Z","title":"Siglip 2: Multilin- gual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.843829Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:f24a188880373925ace14aa94647f39040b09524dc8d0fa2bff423c10afd0be1","observation_id":"89888f0a-8424-4215-86b8-9844169e6c63","resolution":{"observed_at":"2026-08-14T04:28:16.843829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-14T04:28:16.848229Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.848229Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:ea13d9978fb4b53c578718e1a6011565549bf66852a3295ecec302ebc550e9bf","observation_id":"7cbda7ac-2907-4e37-8bc4-7c711c03fa47","resolution":{"observed_at":"2026-08-14T04:28:16.848229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-14T04:28:16.852686Z","title":"SAM 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.852686Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:217a7d51cf275eca8e807ae3e260b9a1ee5c92ecc45d6984cfb3da401042458f","observation_id":"b91af1f3-ef7a-45e0-b3f4-bfb6217fae44","resolution":{"observed_at":"2026-08-14T04:28:16.852686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.344022Z","title":"OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning,","venue":null,"work_id":"b8d6886c-f1dc-4f1b-98fd-2c17b8c2930f","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.857124Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:374384b7584d3620b2e285c2c4814a20ef22c3cae1b63b58695bc9d81dbbd2c7","observation_id":"aa859a75-8b50-443e-89e8-8f6f93efed3d","resolution":{"observed_at":"2026-08-14T04:28:18.352097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04307","last_updated":"2025-09-02T07:20:33Z","snapshot_observed_at":"2026-08-18T12:46:20.983775Z","submitted_at":"2024-12-05T16:26:37Z","title":"Feature Coding in the Era of Large Models: Dataset, Test Conditions, and Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04307","snapshot_observed_at":"2026-08-14T04:28:16.862213Z","title":"Feature coding in the era of large models: Dataset, test conditions, and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.862213Z"},"links":{"cited_paper":"/paper/2412.04307","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:5e4fa63e794cad5dac39c0fe68e64a1f7013600bef21c29eaf58a67136baa5c9","observation_id":"939425c4-6526-47c3-9d9f-523d5baae060","resolution":{"observed_at":"2026-08-14T04:28:16.862213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.324619Z","title":"Vision transformers need registers,","venue":null,"work_id":"c53febce-a28a-4f12-9e4c-82d0fc227b3e","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.866841Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:a910ed61d23dcfc1a5f6bd8101e7c2af1690444772ff8dfb1d01b6bc103b1725","observation_id":"d902ed8c-4478-4416-9c8d-c8964fa2d8ec","resolution":{"observed_at":"2026-08-14T04:28:18.328800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.310335Z","title":"DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Trans- formation,","venue":null,"work_id":"a9c58ce3-c55b-434c-aec8-989068b43f38","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.870949Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:25d63b4a6a5dab4823f3eb688187bf1e6395ec047cf6d4d270d52e21493e58b7","observation_id":"e4a93c31-862c-4a68-a664-c4400ce27532","resolution":{"observed_at":"2026-08-14T04:28:18.314995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.297629Z","title":"Transform-Free Feature Coding via Entropy-Constrained Vector Quantization,","venue":null,"work_id":"0afe653f-270d-45d9-9aef-8475e5ce5b31","year":2026},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.874952Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:67bfee24b406d8500d7d80963ebae3d12d003ed144c5c862149e57922df2814e","observation_id":"6ebd86b1-fdfd-4769-a3b5-aa607fcee88d","resolution":{"observed_at":"2026-08-14T04:28:18.302157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.283142Z","title":"VVC and VTM 11.0: The Versatile Video Coding standard and its reference software,","venue":null,"work_id":"536f0e16-c71b-47b2-a616-44283a6d500b","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.878931Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:41ddb40a5d210a2be43c2d02d2d5adb056cba7a6ac2357cf9f3982a36fb01aab","observation_id":"c4811298-0eec-42c5-9751-dbf07471513b","resolution":{"observed_at":"2026-08-14T04:28:18.287727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:16.883230Z","title":"Variational image compression with a scale hyperprior,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.883230Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:0cac493d8a4f8e456cb85e6490fab3769195a01e8aaf034eab2412e1d4ad8a6c","observation_id":"90b4033d-06e7-4926-bf3d-648bf7b21ebf","resolution":{"observed_at":"2026-08-14T04:28:16.883230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.262098Z","title":"ELIC: Efficient Learned Image Compression with Unevenly Grouped Space- Channel Contextual Adaptive Coding,","venue":null,"work_id":"270d375c-3cb7-4589-b73a-1c7d6ed22475","year":2022},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.887163Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:3ab753905d5593121365b2f93a75770af6b8132c387baf074a0d88595ffb183c","observation_id":"56d989bc-5cac-4e74-854d-bf991784ef43","resolution":{"observed_at":"2026-08-14T04:28:18.266177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.245489Z","title":"Nonlinear Transform Coding,","venue":null,"work_id":"bd43c271-ef7c-4a38-bb11-95cc9a588a31","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.891335Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:8864f034163674297877f53c037459637e4a0e4d156f2f93c55a98a33a8c5111","observation_id":"6d009baf-32a1-491d-b96d-f2f3fd0f1df1","resolution":{"observed_at":"2026-08-14T04:28:18.254409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.232650Z","title":"End-to-end optimized image compression,","venue":null,"work_id":"5f797786-6b8c-44be-8bd9-a97313fccbc0","year":2017},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.895604Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:4522098048769534d734b815ffc61be58deede21ae1b510df980349f377aa1fd","observation_id":"551287e9-e6c8-47f8-a31a-3f154ff577c4","resolution":{"observed_at":"2026-08-14T04:28:18.237069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.220455Z","title":"Joint Autoregressive and Hierar- chical Priors for Learned Image Compression,","venue":null,"work_id":"fe269c03-3795-4df5-a568-21995552482f","year":2018},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.899489Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:db75d68acb1a2fff398158cd6d39c3715b7f6229426fbd96b8e5905737762839","observation_id":"f4150ee7-a3d6-4679-80cb-e6253686f51b","resolution":{"observed_at":"2026-08-14T04:28:18.224770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.207970Z","title":"Learned Image Com- pression With Discretized Gaussian Mixture Likelihoods and Attention Modules,","venue":null,"work_id":"203abb1b-1a40-41cb-a476-fff536103dff","year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.903731Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:7c36f4ab6cc1396dc885bd253fb28045cd26a16fceeae1cffd9f489d7b5954a7","observation_id":"6e2043f8-194c-4a35-b34e-92f90e99a23b","resolution":{"observed_at":"2026-08-14T04:28:18.212189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:16.907809Z","title":"Enhanced Invertible Encoding for Learned Image Compression,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.907809Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:11360586db60db8de8df61d188dba2a2be01fe563428f6b1b46a5ddcf5a5e550","observation_id":"456db18d-a295-45c7-80f1-dc53c73113bc","resolution":{"observed_at":"2026-08-14T04:28:16.907809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.195530Z","title":null,"venue":null,"work_id":"c13b9ba2-8957-44b9-a595-25152888108a","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.911683Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:2ada4b7e08be1d78d553c58ab93463ae4d1da2aa86c9c48946618e9363fd5c22","observation_id":"9dda892b-b615-4de1-8476-6a5307414997","resolution":{"observed_at":"2026-08-14T04:28:18.199838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.182542Z","title":"End-to-End Optimized Versatile Image Compression With Wavelet-Like Transform,","venue":null,"work_id":"532e09cb-d2f8-4c8c-b090-dc8c383478f6","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.916050Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:2a2c46fe3212eaab298b08ac3a5c15c5e1dd3cf23533a69545c51424cfccb8db","observation_id":"e869c0b8-a275-4d0d-b5dd-15749c24edbc","resolution":{"observed_at":"2026-08-14T04:28:18.187529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.166500Z","title":"Transformer-based Transform Coding,","venue":null,"work_id":"5c0d1279-7bba-4a62-9eae-498ad5abd0e2","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.920195Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:e039df6f4b8bddd3433f2a436ac729efec13b40ece263ffd2e531cf7f2de98fe","observation_id":"c60bccf0-1881-4ed5-b89d-d61830f30ba9","resolution":{"observed_at":"2026-08-14T04:28:18.170835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.146276Z","title":"Learned Image Compression with Mixed Transformer-CNN Architectures,","venue":null,"work_id":"fa317890-d466-475a-83eb-3c7a59fbb9a7","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.924231Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:8b2caa9c2f4fe073e153d7abe283e0484f87c6fff286a2039732600090f11a33","observation_id":"d240ac1c-c1a9-49ec-be1f-e45302cf02aa","resolution":{"observed_at":"2026-08-14T04:28:18.150887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.133787Z","title":"Frequency-Aware Transformer for Learned Image Compression,","venue":null,"work_id":"e67aba57-a46c-4ab9-8797-14edb78105c0","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.928006Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:6afbc2bd1f89be1cdc73a596b480ce93fbbdad78681a998d136def80b0e668bd","observation_id":"4e3c0b76-88cd-4ce3-b1c1-1b8e05493a37","resolution":{"observed_at":"2026-08-14T04:28:18.138152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.112625Z","title":null,"venue":null,"work_id":"2ae0f12a-ba22-4264-83d8-b10904d7318f","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.931832Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:81b684875addb5655b3c4ab9b8abd0e70f9679b36e252a8db062f36ccf0ee6f0","observation_id":"cbfd6ee5-ab6b-4a81-9bcf-29d7f32431eb","resolution":{"observed_at":"2026-08-14T04:28:18.122481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.100641Z","title":null,"venue":null,"work_id":"2f42d47f-50c5-4553-87d6-575438c529bb","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.935651Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:cbee406cdf1be95b8da327cb49c993ab67fdf55379e377baa51bc351774a151a","observation_id":"97fa5ad3-31b8-4297-8200-bda2683c4a9b","resolution":{"observed_at":"2026-08-14T04:28:18.104671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.086041Z","title":"MambaIC: State Space Models for High-Performance Learned Image Compres- sion,","venue":null,"work_id":"72b88f37-7d75-4bb7-b2e0-4deef80e6e7e","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.939716Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:4e0fadadffaea936709fb89a424398ecec0cfa7c7c6dcf7d3206fc962850a987","observation_id":"e308bd92-d009-4014-9769-7332b9d82d69","resolution":{"observed_at":"2026-08-14T04:28:18.090519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.073635Z","title":null,"venue":null,"work_id":"66280602-1d48-44a3-b558-2a8cfaca7958","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.943481Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:4150c35e5db911f7eea541ed3a5aad3258e68cafe07cdeffb634d310bc53e372","observation_id":"f0b7900a-c0e1-4a6c-b8f1-3b4b4f7ba270","resolution":{"observed_at":"2026-08-14T04:28:18.077627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.058208Z","title":null,"venue":null,"work_id":"8b6a031c-4ca0-4ec0-a7ea-b30d8dbd0088","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.947520Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:21dd9fcd84c43cd04eca9cc162c5ed54706e52358b25c457e609a428e23271a8","observation_id":"cb7e82b7-b74e-4608-a24b-e1f8a356b96e","resolution":{"observed_at":"2026-08-14T04:28:18.063841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.045118Z","title":"Linear Attention Modeling for Learned Image Compression,","venue":null,"work_id":"abbeb848-6366-40d6-b4c5-2248a4880b45","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.951629Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:d5dea7eeef89b36581b7b4f142ba22be9d7f9695a3abb8a30623af068a4bc891","observation_id":"abb60aa7-69d1-4bd6-a082-ded678c992ff","resolution":{"observed_at":"2026-08-14T04:28:18.049871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1142165","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.445028Z","title":"Distilling complexity-scalable learned image compression models via neural architecture search,","venue":null,"work_id":"2fee9992-48b3-4fe6-b371-fd6bdacea66e","year":2026},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.955365Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:fefe7af69a8c7d4fa37bfdc8799b69971c321c8d2eb1aa48d61fc30198b39c50","observation_id":"beb0e65f-ad60-43b1-b943-503aa9d72ed8","resolution":{"observed_at":"2026-08-14T04:28:17.451049Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.028219Z","title":"EVC: Towards Real-Time Neural Image Compression with Mask Decay,","venue":null,"work_id":"f3c7521d-7898-493c-a61e-12a744d72755","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.959515Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:7ddc77177aa15f552d66d7d0e8814cddaa832566af48c4f7167e9c995c25fd95","observation_id":"703f94dc-5a50-40cc-9e63-345a59541011","resolution":{"observed_at":"2026-08-14T04:28:18.033085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:18.011872Z","title":"Towards practical real-time neural video compression,","venue":null,"work_id":"84360e9b-d9db-4a01-9d4b-37146e2b53b6","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.964275Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:a8fff108db3c2413d0abdeff0b61c7accee38fb4b8876e21d680fbbbf156ad0f","observation_id":"51ffdcd3-a94d-4059-8928-dd9a3e364a24","resolution":{"observed_at":"2026-08-14T04:28:18.016688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:16.968303Z","title":"Checkerboard context model for efficient learned image compression,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.968303Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:8b5b76f9dba8403cdd680c923c7df743c07f7d9b9304d7be08d2b6e20b11be1f","observation_id":"4dfe1035-d4a9-4311-8acd-d8751958e51d","resolution":{"observed_at":"2026-08-14T04:28:16.968303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.984820Z","title":"Channel-Wise Autoregressive Entropy Models for Learned Image Compression,","venue":null,"work_id":"dc835ed0-2d14-4796-8e92-f499c81bd081","year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.972243Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:df659b01687e80b1139b1e4d535925757efbe2051e3977182a674902d79289a6","observation_id":"2e245178-9ece-4ad5-953f-3a60d2ac94f3","resolution":{"observed_at":"2026-08-14T04:28:17.989513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.970485Z","title":"MLIC: Multi-Reference Entropy Model for Learned Image Compression,","venue":null,"work_id":"077b35b4-0a06-4495-ab1a-1a011670a5a8","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.976154Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:7f622826d31be339c242db85bdac32eaaa32b0a259df1e457378abaec46b3ae4","observation_id":"8d877eca-af07-4632-be6c-2eb59d3a39a2","resolution":{"observed_at":"2026-08-14T04:28:17.975265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.956112Z","title":"MLIC++: Linear Complexity Multi-Reference Entropy Modeling for Learned Image Compression","venue":null,"work_id":"05468d74-829e-4021-98ca-4e3f4e8bb0d8","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.980713Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:bc16e0fe48708d9193c5fdcabcca19bc403576ad5da621514699068623597d48","observation_id":"6ab54182-7915-4327-aa61-fc77241f2ca6","resolution":{"observed_at":"2026-08-14T04:28:17.960813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.936066Z","title":null,"venue":null,"work_id":"feb13c6d-97e4-4d4d-96b9-b6c3555b3fde","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.985036Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:75509a39b6ae573df8b2d013c2bc69cfadc2f46feb64c30c4f7a967c96cf9a38","observation_id":"e295b671-29e3-4846-88ac-bb8df6767450","resolution":{"observed_at":"2026-08-14T04:28:17.941544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.921651Z","title":"Contextformer: A Transformer with Spatio-Channel Attention for Context Modeling in Learned Image Compression,","venue":null,"work_id":"2a535643-5871-4385-8a17-b486107acf44","year":2022},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.989128Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:986087c8e1c6fd573e34aa4b7be3b6037d65600f15b562383247a99804017f44","observation_id":"3842660c-f2db-41fb-b3be-9d98d8b06440","resolution":{"observed_at":"2026-08-14T04:28:17.926371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.906240Z","title":"Efficient Contextformer: Spatio-Channel Window Attention for Fast Context Modeling in Learned Image Compression,","venue":null,"work_id":"71f6fadf-19ff-458e-8681-844af45dd429","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.993445Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:8a0da32e388ea91845556eb4a0813fd58a4d8326bb50f05f7122fbd0f04906a1","observation_id":"02ddbd9f-6784-42b1-b113-17551b6b6cad","resolution":{"observed_at":"2026-08-14T04:28:17.911307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04661","last_updated":"2020-05-10T13:28:18Z","snapshot_observed_at":"2026-08-09T21:22:58.968110Z","submitted_at":"2020-05-10T13:28:18Z","title":"Learning Context-Based Non-local Entropy Modeling for Image Compression","version":1},"cited_work":{"arxiv_id":"2005.04661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.04661","snapshot_observed_at":"2026-08-14T04:28:17.386198Z","title":"Learning Context-Based Non-local Entropy Modeling for Image Compression","venue":"eess.IV","work_id":"7cb3d509-da4d-4f85-be9d-57c410a1cf4a","year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:16.997430Z"},"links":{"cited_paper":"/paper/2005.04661","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:05bcf13f1d0cfc15e5053e6498a241de7c85ab2e1b19e6dd5b2aa308ca07f11e","observation_id":"a55f8753-c8e9-4756-8121-2509bd40cdc3","resolution":{"observed_at":"2026-08-14T04:28:17.390663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.002209Z","title":"Video coding for machines: A paradigm of collaborative compression and intelligent analytics,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.002209Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:b0b411597601b8c1d85e647f47822ebed86ff7549ea8afeb04287eb27be0cbb9","observation_id":"d9a32c24-c0c0-422b-87a6-bdd03a6b9e29","resolution":{"observed_at":"2026-08-14T04:28:17.002209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.006371Z","title":"Video coding for machines: Compact visual representation compression for intelligent collaborative analytics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.006371Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:7e76f230d53db18ff023a52f5d2b9f8c4127f9d15c670348b4cbf7b66b655019","observation_id":"bb0e904f-477a-4685-84e2-14abc38ad38e","resolution":{"observed_at":"2026-08-14T04:28:17.006371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.870220Z","title":"Human-Machine Collaborative Image and Video Compression: A Survey,","venue":null,"work_id":"16b339a7-46df-479c-b6cd-1bc0fd097747","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.010402Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:9e18fa07f53ac5cd3e259658ed5af6edb2eed29af58629360339723b33a870a2","observation_id":"860a3d97-6f2c-4c43-8a08-976e8120f90f","resolution":{"observed_at":"2026-08-14T04:28:17.874885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.857335Z","title":"Call for proposals on feature compression for video coding for machines,","venue":null,"work_id":"ff47974c-59d4-42e4-8a61-8586dc638c94","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.015042Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:d3ffd57bd230e526fc3f2e4dedce9b3d1c959b8de635ab65815b3250ebea03c4","observation_id":"935b4398-0a34-4246-a43b-e38bcf9c6e26","resolution":{"observed_at":"2026-08-14T04:28:17.861515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.843649Z","title":"Toward Intelligent Sensing: Intermediate Deep Feature Compression,","venue":null,"work_id":"b436a6d0-332f-44a8-aee0-132f722ceab0","year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.019123Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:52d65dc4dbc898c05794f3a29dab61253931a181eda5c97968a40fb161cf222e","observation_id":"943bfbc4-d6ff-41f5-9379-0a149aea57ef","resolution":{"observed_at":"2026-08-14T04:28:17.847811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.824268Z","title":"AlphaVC: High-Performance and Efficient Learned Video Compression,","venue":null,"work_id":"03c94d28-02f3-4a03-803a-ef35334a36fe","year":2022},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.023105Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:87b92c6d05f4a6be6e1c232e722fc8188b617e84a3526133a28ae9c3221c0a2f","observation_id":"768d4133-f79e-4ea3-ad56-31a9cc4bdd16","resolution":{"observed_at":"2026-08-14T04:28:17.833549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.809666Z","title":"MIMT: Masked Image Modeling Transformer for Video Compression,","venue":null,"work_id":"e994b040-88bd-47fc-b433-00e82b6df341","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.027284Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:ad87e9fdf7c29c52c0a8b40aae5b471cade5c626b905ebe3ca45a43ca23fef40","observation_id":"9458dc65-8a80-4c7c-aea1-ddfc5243a664","resolution":{"observed_at":"2026-08-14T04:28:17.815715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.794243Z","title":"FLA VC: Learned Video Compression with Feature Level Attention,","venue":null,"work_id":"5e1cdcc0-a7ed-4e46-8969-004994c02cb0","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.031467Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:a808b869148b2b0c2fd2111e60a2fe59bde87a848d2f06aebe142dba9a68780a","observation_id":"08b8f5bb-8617-418b-ae51-2988cb3a2ac9","resolution":{"observed_at":"2026-08-14T04:28:17.800885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16670","last_updated":"2023-08-08T05:00:58Z","snapshot_observed_at":"2026-08-16T15:20:11.457643Z","submitted_at":"2023-06-29T04:05:13Z","title":"End-to-End Learnable Multi-Scale Feature Compression for VCM","version":3},"cited_work":{"arxiv_id":"2306.16670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.16670","snapshot_observed_at":"2026-08-14T04:28:17.368119Z","title":"End-to-End Learnable Multi-Scale Feature Compression for VCM","venue":"cs.CV","work_id":"c97b3375-9aec-413d-86d5-223e66a11e91","year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.035641Z"},"links":{"cited_paper":"/paper/2306.16670","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:23e4e8cb61f910a5443fb645092af9fa6dc110c05ef2258212cd02dcefb51dfb","observation_id":"7627733e-df5e-4365-a91a-8fcdbcbd0004","resolution":{"observed_at":"2026-08-14T04:28:17.374236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.039504Z","title":"Learnt Mutual Feature Compression for Machine Vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.039504Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:ca6b73699a8f7934e44b8d9ad881f343fd58eed10baf5a2cdaa851c4a607438d","observation_id":"3e1728ab-a82c-4327-ad98-ffbd80e69da0","resolution":{"observed_at":"2026-08-14T04:28:17.039504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.781980Z","title":"Sensitivity-aware bit allocation for intermediate deep feature compression,","venue":null,"work_id":"583e1732-7660-4092-a547-3bdf54e0403e","year":2020},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.043322Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:e69c347e11f3126fc72d3fe49e15ef4ff3af34546db57f489383fe780073dc2d","observation_id":"d84eda67-0909-4c3a-8ff2-c0436e8849c7","resolution":{"observed_at":"2026-08-14T04:28:17.785887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.770694Z","title":"Feature compression with 3d sparse convolution,","venue":null,"work_id":"025eab33-0430-4a3f-93a7-3308a27ee6f8","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.047282Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:6c1fffa7e9641a02d20cbdd6dc339035fda9e77045293d9f8601107b5d66c99b","observation_id":"7117eb8e-228b-404e-9fdb-6728a4bb43f6","resolution":{"observed_at":"2026-08-14T04:28:17.774974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10089","last_updated":"2021-05-21T01:56:05Z","snapshot_observed_at":"2026-08-16T18:23:14.210524Z","submitted_at":"2021-05-21T01:56:05Z","title":"Latent-space scalability for multi-task collaborative intelligence","version":1},"cited_work":{"arxiv_id":"2105.10089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.10089","snapshot_observed_at":"2026-08-14T04:28:17.286592Z","title":"Latent-space scalability for multi-task collaborative intelligence","venue":"eess.IV","work_id":"be7a182f-8ad0-43ad-bb6d-fd584f1d46da","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.051052Z"},"links":{"cited_paper":"/paper/2105.10089","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:f5412b0e79a50653d05c068f2fca4521543959447a06233d4e70604b65aba890","observation_id":"bae0d763-9a58-44fd-a042-ae828d7b0cc5","resolution":{"observed_at":"2026-08-14T04:28:17.291194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04044","last_updated":"2024-05-07T06:29:52Z","snapshot_observed_at":"2026-08-16T13:54:48.368747Z","submitted_at":"2024-05-07T06:29:52Z","title":"DMOFC: Discrimination Metric-Optimized Feature Compression","version":1},"cited_work":{"arxiv_id":"2405.04044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04044","snapshot_observed_at":"2026-08-14T04:28:17.267569Z","title":"DMOFC: Discrimination Metric-Optimized Feature Compression","venue":"cs.CV","work_id":"d20d0d1f-6118-42e0-9ca9-dae3fa2ad97c","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.055164Z"},"links":{"cited_paper":"/paper/2405.04044","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:544640cd5bf6a3472c7d808a8d4d1525057740ca0fc1e78f141cfe6b7a1ed056","observation_id":"1dda6253-80be-4d95-bbc3-b9233421539d","resolution":{"observed_at":"2026-08-14T04:28:17.274287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1068964","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.248806Z","title":"IMOFC: Identity-Level Metric Optimized Feature Compression for Identification Tasks,","venue":null,"work_id":"6ce9518d-cb77-4b6c-93a7-4e7a888b9bb0","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.059144Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:c3c61815ae24acd8bed17931fb5a227ff5aa062f14cbfe30466e6f13ee880abb","observation_id":"cfc761cf-65fe-4dab-adc1-2a885fcf2ccf","resolution":{"observed_at":"2026-08-14T04:28:17.255720Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.753286Z","title":"Rethinking joint optimization in feature compression: Insights from person re- identification,","venue":null,"work_id":"81b6aa61-7698-481b-9591-262997cd03c9","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.062696Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:78475dfeb55e9ce02e097bb70e0a4aa7f3264d3380904e0b7cb89f583e78f0af","observation_id":"0b83ca89-6881-431a-ba99-78f5ece06793","resolution":{"observed_at":"2026-08-14T04:28:17.757758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.741017Z","title":"Compressed feature quality assessment: Dataset and baselines,","venue":null,"work_id":"b566df2a-f634-4ca0-8766-8faeb4f53101","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.066411Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:7c638bf116795609831a7152868c460afb672113afd1aff63c718b119fd8c940","observation_id":"f0e1aded-7d99-4157-ac5b-68e7ae79db57","resolution":{"observed_at":"2026-08-14T04:28:17.745222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.728658Z","title":"Scalable Facial Image Compression with Deep Feature Reconstruction,","venue":null,"work_id":"b86f5cef-35f0-4bef-ab22-88e3d8e990f8","year":2019},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.070170Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:80db676f2dd81425edd282f537ef0979e8a6fc82fab2b1ba000b4315af9e574e","observation_id":"499f9489-4402-4934-8642-95c47953b211","resolution":{"observed_at":"2026-08-14T04:28:17.732926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.714957Z","title":"Towards coding for human and machine vision: Scalable face image coding,","venue":null,"work_id":"963c4779-a350-4472-b637-e2f56ad7bf22","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.073796Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:c66b063d3d2aa1426df02bb7509e6f6ba5a0e6e35da2fc228e71e38d5eb38b5a","observation_id":"4912f3fd-e53b-46bf-ac1d-59b27c09c5a0","resolution":{"observed_at":"2026-08-14T04:28:17.719949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.702285Z","title":"SSSIC: Semantics-to- Signal Scalable Image Coding With Learned Structural Representations,","venue":null,"work_id":"a805508b-635c-4781-8512-483dafa6db53","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.078041Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:640a45fc1b6731d6dd779a5efe7e4ea985979c39b2bca63c5097ddd3261efe88","observation_id":"0849ef8a-fd75-4628-b71b-a318dd48d995","resolution":{"observed_at":"2026-08-14T04:28:17.706713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.689039Z","title":"Semantics-to-Signal Scalable Image Compression with Learned Revertible Representations,","venue":null,"work_id":"074b8ff2-3ca5-4d2b-baa4-a33164c2d9ce","year":2021},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.081309Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:25041ee32d68c53e3318588a7b36ce660ca9b3e287d4bf65563fd603e8b5100c","observation_id":"bdce8b0d-d284-4cc1-9e04-d16fb9f6a895","resolution":{"observed_at":"2026-08-14T04:28:17.693082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.675121Z","title":"End-to-End Learned Scalable Multilayer Feature Compression for Machine Vision Tasks,","venue":null,"work_id":"6f1e4efc-7e36-42a4-b092-8fb020acb1ba","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.085658Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:f46f18d70578a8a91d9a15a98527ba8cc841fd9fffcaf18db2a3264059af9dbd","observation_id":"44e616b9-1565-43d2-90eb-80ee70860ec8","resolution":{"observed_at":"2026-08-14T04:28:17.679952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24025","last_updated":"2026-05-20T13:39:48Z","snapshot_observed_at":"2026-08-16T20:14:54.631121Z","submitted_at":"2026-05-20T13:39:48Z","title":"Towards Large Model Feature Coding","version":1},"cited_work":{"arxiv_id":"2605.24025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24025","snapshot_observed_at":"2026-08-14T04:28:17.167555Z","title":"Towards Large Model Feature Coding","venue":"cs.CV","work_id":"97c48233-37de-401c-956c-04b16a324371","year":2026},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.089597Z"},"links":{"cited_paper":"/paper/2605.24025","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:6387ecb8dbbe16e308e45bffca200fb9b6982c48f22556c77ad1852eedbb6fa1","observation_id":"070edd12-6c2c-4d65-9784-437d3aae9105","resolution":{"observed_at":"2026-08-14T04:28:17.173662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.662796Z","title":"Compression of Self-Supervised Representa- tions for Machine Vision,","venue":null,"work_id":"58a60885-92ca-468c-85c0-bd93ab989824","year":2024},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.093678Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:fefda069bb8553a0d290f64aaec7eeb04a9f3aa54c67e7e464469b7a8b5afc98","observation_id":"c0b33474-a197-4a1d-99c0-188e1984ff0c","resolution":{"observed_at":"2026-08-14T04:28:17.666988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.649144Z","title":"Cross-architecture universal feature coding via distribution alignment,","venue":null,"work_id":"7226e5d2-e2bb-4491-9f5c-282e48d3acc3","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.097363Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:fd160c6f76f62fe47ecb8e071ab4579d458599b216cd5a9b12ba82dc3bd80617","observation_id":"55b220b0-124d-4db5-bd54-ef0a450c3f62","resolution":{"observed_at":"2026-08-14T04:28:17.653727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.630746Z","title":"Multirate Neural Image Compression with Adaptive Lattice Vector Quantization,","venue":null,"work_id":"4806dc97-ff83-4e6f-a894-ae898928328e","year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.100994Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:2fac7dbfda3d0c77a0702de0a07e2b14412ec3e3532b970b1dbf4208c588cda6","observation_id":"ac260cbf-b0bd-4b1e-a6aa-26e7caa4bd3c","resolution":{"observed_at":"2026-08-14T04:28:17.640353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.617638Z","title":"Zhang, Y","venue":null,"work_id":"96e1de55-6c2f-4b42-9c19-f1854f2d8b1a","year":null},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.104725Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:4f1bbf892ede16387e4767a057db6c1bb21d6d1f3c6d95321a4f06b1ce2d3faa","observation_id":"c036d20e-7b4f-48bb-8232-fa377de73869","resolution":{"observed_at":"2026-08-14T04:28:17.621704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.108778Z","title":"ImageNet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.108778Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:adf52398e7a040f1fd373b6115d0b96f368b51499593071d2894ad7aa2297f5a","observation_id":"e0d5622e-ccce-4f18-ad62-7b1a3dec94fc","resolution":{"observed_at":"2026-08-14T04:28:17.108778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.598304Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"124afa9f-f215-4d1e-9925-bd265c634d0e","year":2014},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.112341Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:320ee6d4efc7148cabadf3c44966e5018bd8205fba8f3310bcae63e32fad4484","observation_id":"236bced9-8652-4f10-a1b3-e79b125d3496","resolution":{"observed_at":"2026-08-14T04:28:17.602260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.586086Z","title":"Scene parsing through ADE20K dataset,","venue":null,"work_id":"e4cee907-ff2e-446c-9476-0ff4dc27d208","year":2017},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.115755Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:9cb327b1e0c8fd57147ea201ba3c8c7b6be57c9a62934e62e0c2aee2e0055360","observation_id":"6d007847-6d5f-4793-a138-42f34cd52e5e","resolution":{"observed_at":"2026-08-14T04:28:17.590339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:28:17.119375Z","title":"Calculation of average psnr differences between rd- curves,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.119375Z"},"links":{"citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:69b65ae08d56f635b7748724ee56290f98f61b3b5eb1ffc4dc98cf0ec6d84dcd","observation_id":"01648681-8daf-415b-9864-c927c8aaa655","resolution":{"observed_at":"2026-08-14T04:28:17.119375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-14T04:28:17.123060Z","title":"Diffusion transformers with representation autoencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:17.123060Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.08832"},"observation_digest":"sha256:a1bd548fa665cf1122a8a6ede80be116844c941f144df03a48af479fcdbca6c4","observation_id":"12e70c59-373e-4b12-974e-2b2c7ad7515d","resolution":{"observed_at":"2026-08-14T04:28:17.123060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08832","last_updated":"2026-08-09T17:32:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:38:36.052667Z","submitted_at":"2026-08-09T17:32:04Z","title":"Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":7,"verified_fuzzy":44},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.08832."}