{"as_of":"2026-08-09T05:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b098ad13f78d1215ac089c09625e298396bca12d142958e1c5d2d2bd4481c70","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:47:13.856071Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23532/citation-record","integrity":"/paper/2506.23532/integrity","json":"/paper/2506.23532/citation-record.json","paper":"/paper/2506.23532"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.816560Z","title":"Slic superpixels compared to state-of-the-art superpixel methods","venue":null,"work_id":"a822e6ca-d38a-4910-85dd-da0e7989ae5d","year":2012},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.014039Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:8b9475d008af7f006478b4a9eda862c8bf65702f295c730295a394124fe258dd","observation_id":"9945d05e-7020-4d1e-9ab0-bd728522523a","resolution":{"observed_at":"2026-08-06T21:47:18.892758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T21:47:11.069323Z","title":"Beit: Bert pre-training of image trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.069323Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:938bd625bbda7c5793d7e0e2e039c8848ff21d44c78bd079e87eeaf94751b740","observation_id":"2c890d52-e762-428e-9657-dad3cf888b27","resolution":{"observed_at":"2026-08-06T21:47:11.069323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.719405Z","title":null,"venue":null,"work_id":"6fafe7d2-96df-46df-9970-e7947c92a7c6","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.138184Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:42e2acc074513e7652222eff4eeede565698ff677faad4971f6e2f473b543dbb","observation_id":"0092c7e7-3d0d-4b55-b20f-f251c06928f2","resolution":{"observed_at":"2026-08-06T21:47:18.746717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02364","last_updated":"2024-10-25T08:27:37Z","snapshot_observed_at":"2026-07-06T16:56:53.868165Z","submitted_at":"2023-12-04T21:46:21Z","title":"Class-Discriminative Attention Maps for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02364","snapshot_observed_at":"2026-08-06T21:47:11.202139Z","title":"Class-discriminative attention maps for vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.202139Z"},"links":{"cited_paper":"/paper/2312.02364","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:7ca6d8ee3142fccc6ce83daf824309f489c9181a392b64e8eac622a6af97f58a","observation_id":"5910e295-c639-4bc8-80ed-03a55f33dc01","resolution":{"observed_at":"2026-08-06T21:47:11.202139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.235366Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.235366Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:bb47da233c3e93ce073c0ae971fea7d9400630505f619752af81ad15ef91891a","observation_id":"fd5ef612-735c-428c-a5a7-dfeddb721ae2","resolution":{"observed_at":"2026-08-06T21:47:11.235366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10555","last_updated":"2020-03-23T21:17:42Z","snapshot_observed_at":"2026-08-06T14:37:14.514749Z","submitted_at":"2020-03-23T21:17:42Z","title":"ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10555","snapshot_observed_at":"2026-08-06T21:47:11.283757Z","title":"Electra: Pre-training text encoders as discriminators rather than generators","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.283757Z"},"links":{"cited_paper":"/paper/2003.10555","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e0337f92c0157f89fbf7b30b45c11bb0bcde9595ee196fe1884ee39fb44855c0","observation_id":"936e8e54-4ae0-45ba-b2b1-bb233b9fc377","resolution":{"observed_at":"2026-08-06T21:47:11.283757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.577859Z","title":"Vision transformers need registers","venue":null,"work_id":"bbbdeb00-bc53-4c49-ad9f-127a1c10b9fd","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.350695Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:790ea6fef3e182b609142b34edea62c0634f6c8525ee42f1ecfc5b55c296c499","observation_id":"f4c5c823-5540-4b5a-b51a-db3931724776","resolution":{"observed_at":"2026-08-06T21:47:18.656085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.395995Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.395995Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:fd82eb0aa318eafa1c5562095812f8c7215336d6f6d1472cb9fca97cec547ca8","observation_id":"37e73944-bae5-47a0-860c-c20c99361830","resolution":{"observed_at":"2026-08-06T21:47:11.395995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.450427Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.450427Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:63a0cab8ca6153136cac7faa0a86e42dbaf59ace2443d97c4f32f85d1791e360","observation_id":"fdd7961f-9de7-4c5f-be6a-aead69cc1528","resolution":{"observed_at":"2026-08-06T21:47:11.450427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.415360Z","title":"Adaptive slot attention: Object discovery with dynamic slot number","venue":null,"work_id":"71a1b351-57e9-4fcb-b1db-839334be6850","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.569998Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e5d35eea611f1270c624a82cf81070fecb3a0c6852875ab9f9ac280bcb722804","observation_id":"9c3db3c5-a6d1-4b5d-ba0d-e706919159f9","resolution":{"observed_at":"2026-08-06T21:47:18.466824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.313662Z","title":"3d gaussian splatting as new era: A survey","venue":null,"work_id":"2191ea88-87fb-432c-8d2a-a738781f6dcd","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.604742Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d6d3bbd4fd24cb7249d38f70e034e5b4d4783daa4050ea25cd5bee491266764d","observation_id":"f66e188e-2881-48ee-bffe-e431d0f62f50","resolution":{"observed_at":"2026-08-06T21:47:18.364413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.190804Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"0fce1091-407b-4250-82a7-6e06d96ffc85","year":2004},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.656350Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:11b49245f743413f05f1612a040ea07e82e49e9ca9bf474ed867c45da678063f","observation_id":"c1fc16db-617d-46d9-86a7-162eed514be1","resolution":{"observed_at":"2026-08-06T21:47:18.238363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.062803Z","title":"Understanding the difficulty of training deep feedfor- ward neural networks","venue":null,"work_id":"e7a82d4f-f44d-4198-bcfa-ab95922a69ae","year":2010},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.719489Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:4802b3e46b3381298cf14661badd90649ef12114c7982505eaf2d2c0aa97cb30","observation_id":"579af9de-e56a-451e-b5b9-2714f0311f26","resolution":{"observed_at":"2026-08-06T21:47:18.119540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T21:47:11.771826Z","title":"Explaining and harnessing adversar- ial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.771826Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e78a7bc8d16f89cb9faa86b8b718c8efd23714d70aff2ed247acc1b4d0cf09c8","observation_id":"ff0bb9f3-9761-48f2-affb-e7a0de90b98a","resolution":{"observed_at":"2026-08-06T21:47:11.771826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-06T21:47:11.840094Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.840094Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e13bca41f6b72a68ff8ea767cfe91040f2fad39f0e188feb6321bb291fafab29","observation_id":"b192aebd-5bf7-4416-977f-feba17913d7e","resolution":{"observed_at":"2026-08-06T21:47:11.840094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.932259Z","title":"Faster neural networks straight from jpeg","venue":null,"work_id":"3053297b-650d-4a03-ad7b-8436e2822e36","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.888156Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e0e842dfe367d9b7f1bf862cd0d416d9a637692300c21efd3982b69ee4fe8f41","observation_id":"3c6a61b4-d77f-49b5-bc12-b73b59d2e83d","resolution":{"observed_at":"2026-08-06T21:47:17.992426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.946548Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.946548Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e78daf3deb811771426ea7f32c976655026fe88797eddd8f6612fa3cf3fbafa2","observation_id":"dc0b8bf2-6a07-4b45-a0b1-4398de97033a","resolution":{"observed_at":"2026-08-06T21:47:11.946548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.834964Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":"7785d6ef-1860-4ef5-8cf3-028640e25ddb","year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.019522Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9697a2d0119cc59eabc5060be04d0de2a9ffc0e9aa84e7f9ff9d15f33ce4b466","observation_id":"261a297a-38f0-42d1-a87a-84055dd8365c","resolution":{"observed_at":"2026-08-06T21:47:17.880417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.713825Z","title":"Bytes are all you need: Transformers operating directly on file bytes","venue":null,"work_id":"5851e72b-a894-46a4-a620-df070a050566","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.058765Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:176454e5134be78da70e8fc7052436750ee1f273e6d8153b6ec2f41a248f0b47","observation_id":"846f3813-b848-4d05-990d-3c5ce50e77ea","resolution":{"observed_at":"2026-08-06T21:47:17.757233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.602604Z","title":"2d gaussian splatting for geometrically accurate radiance fields","venue":null,"work_id":"19d1527d-9b5b-4d5d-bd31-447513f7dca4","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.080524Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:7849d309ea94b63112d1b365ee450b6ea8441ac28f7968c4692077872b944395","observation_id":"200ecfb6-b37f-43f2-9086-224e9134a633","resolution":{"observed_at":"2026-08-06T21:47:17.643782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.478799Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","venue":null,"work_id":"60bd5df6-a45f-4341-9e01-2c3b8f3b9a0e","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.133865Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d2dfb49daf1d9077dc7982e4b81863aeba9eeb924643cee50c35c709e39d866c","observation_id":"fa411bc1-4037-4db5-8286-9e0aeb480988","resolution":{"observed_at":"2026-08-06T21:47:17.543035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.344035Z","title":"Perceiver IO: A general architecture for structured inputs & outputs","venue":null,"work_id":"c0c173d1-6171-493f-acfc-653d8ef31772","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.186546Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:f51214757ffbc8cf218a234eac93b78cdda0eaf70228e6ab96462e5ae1e4147b","observation_id":"8b67a148-fc63-4ce8-97dd-954a45b029db","resolution":{"observed_at":"2026-08-06T21:47:17.398396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.241166Z","title":"Perceiver: General Perception with Iterative Attention","venue":null,"work_id":"66721b5a-bcf4-4025-bc6b-d216185faef0","year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.228976Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:93d0880fe4a285d7db8de7f1858960646db31d4ae5c110aaa753e79f9b6253aa","observation_id":"b1e8f434-2fcf-4c5b-a4b2-4ecf418d0a53","resolution":{"observed_at":"2026-08-06T21:47:17.294073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.107100Z","title":"Superpixel sampling networks","venue":null,"work_id":"82ea55e3-e0bd-40ba-834c-548e2f500053","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.286148Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:5b39e2708f59e0ae8fee298d069d74e6ed68ad3b0193d80bb64a08114fe04e7d","observation_id":"ea2f901f-f3cd-4cd1-80f6-79f9c737a85f","resolution":{"observed_at":"2026-08-06T21:47:17.179891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.016509Z","title":"Unsupervised image segmentation by backpropagation","venue":null,"work_id":"3f232c53-a304-4d02-bda6-13f0e7f218fa","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.336586Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d19eefa493e81a1fa69e53b8865e8097797dc3a978e453c3a1c1815a2c11c7da","observation_id":"3738d5c8-68ff-4a31-be72-2ea36e1b9ea0","resolution":{"observed_at":"2026-08-06T21:47:17.066064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.918040Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"cee0cc23-2ef9-47b8-bb78-e703533e9313","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.396900Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:f10a7ef4f57ace62e9bf7a53eb211c97d2be633d590c956c52a18e34ad662017","observation_id":"56d5519e-e377-4930-93b9-f89ca3ee78ca","resolution":{"observed_at":"2026-08-06T21:47:16.962101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.706884Z","title":"Seac and the start of image processing at the national bureau of standards","venue":null,"work_id":"44cd3dfa-bde5-4e01-b943-e44f9ec7a7ff","year":1998},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.452282Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:49b8738d2417c2903ac373829f64a967388750c66ea9e270d6e3bbb7a7b5021e","observation_id":"a6efc2d2-c4bc-4755-a961-289d45fa081b","resolution":{"observed_at":"2026-08-06T21:47:16.825354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.533113Z","title":null,"venue":null,"work_id":"5fca79c3-4215-45ec-b392-2071160d7e17","year":2012},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.508278Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:614f81aef1b76f0d80f21fc7b93060846ca08e9d206716b770102e2e165141c0","observation_id":"7ab25380-ec07-491d-b429-42da834e935e","resolution":{"observed_at":"2026-08-06T21:47:16.628991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.300185Z","title":"Kutulakos, David J","venue":null,"work_id":"42381cd8-fe6a-439e-bf87-9abddbcc189d","year":2009},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.567226Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:271c8022ac2aa17525901bbf4874fd13b2e9e46c7606d8a4590f787abbcb8607","observation_id":"6ba2d68d-75c3-4501-8c4f-b387e64c880e","resolution":{"observed_at":"2026-08-06T21:47:16.415159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-06T21:47:12.598568Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.598568Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:ffa2261ee9f665bff6049adec1990f4fec4188ea7f83d3b381b344e17309c986","observation_id":"a6cba2a0-19ec-475c-a0c7-e0cc0eefc094","resolution":{"observed_at":"2026-08-06T21:47:12.598568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.164892Z","title":"A convnet for the 2020s","venue":null,"work_id":"d85090ce-bd26-42fe-becd-147c9b5880c9","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.646382Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:8d3e78eb0fe825218f28b27e91c3a572359c436e5e9ea19b449c3a7f4c08c654","observation_id":"2c815d31-fe80-4758-a764-4601fe534137","resolution":{"observed_at":"2026-08-06T21:47:16.205710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:12.704280Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.704280Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:597167785d336b2f661c0a68990100ac98c52e8c736861ea8e583fc072e9c75c","observation_id":"bdd6e5d4-4c34-4d8b-9461-9dcca0ac6c66","resolution":{"observed_at":"2026-08-06T21:47:12.704280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.051388Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"ef40cf07-58d3-4c4f-8365-752b18e8db16","year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.746140Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:15c14f4c0e2b325ff0464ebe01a136df895f8852623268c33090d6f1f4713e71","observation_id":"d926a667-08f5-4c40-bb5b-b0e508e55a00","resolution":{"observed_at":"2026-08-06T21:47:16.093469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:47:12.793127Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.793127Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d85a69e398f49b8f8e327ab07f4a4ed3852e604fc685c29d80b47a8ea5fd6916","observation_id":"30cabcaf-6846-453f-a2e5-9f7095397d4b","resolution":{"observed_at":"2026-08-06T21:47:12.793127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07735","last_updated":"2022-09-16T06:25:06Z","snapshot_observed_at":"2026-07-06T13:52:55.040189Z","submitted_at":"2022-09-16T06:25:06Z","title":"Enhance the Visual Representation via Discrete Adversarial Training","version":1},"cited_work":{"arxiv_id":"2209.07735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07735","snapshot_observed_at":"2026-08-06T21:47:14.258461Z","title":"Enhance the Visual Representation via Discrete Adversarial Training","venue":"cs.CV","work_id":"b17aa2fc-85b5-4d9f-89b5-16acadc2f192","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.882028Z"},"links":{"cited_paper":"/paper/2209.07735","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9a3ab167434bb0b6df87f4d98cc1445202f3e5647da8d169b6ecbdc2ebc06343","observation_id":"f9c6bfc4-7a58-4297-a4ed-650674a643db","resolution":{"observed_at":"2026-08-06T21:47:14.362286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.908799Z","title":"An image is worth more than 16x16 patches: Exploring transformers on individual pixels","venue":null,"work_id":"d4caadc3-5254-4261-b0a5-62721a3a0451","year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.940750Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:bd24d3a16d2529db18dc6dfdca8b4be08b97f8144f4aa9af5ae84570ccfb6100","observation_id":"cf18a7bb-9b6b-4674-8f32-bc1ff44f1e3c","resolution":{"observed_at":"2026-08-06T21:47:15.980100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.826636Z","title":null,"venue":null,"work_id":"b955f1be-750a-4660-9243-497937a01c8a","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.965051Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:4d13d095a74e4802e392c4f4e71f3d40fe07f5aeee7dad727745dd2e7af67575","observation_id":"42d1f6b9-685f-462f-9500-ad2e411fcf97","resolution":{"observed_at":"2026-08-06T21:47:15.875334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.638320Z","title":"Rgb no more: Minimally-decoded jpeg vision transformers","venue":null,"work_id":"24e1d057-538c-4a58-838c-8690b2909cf8","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.993161Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:73f2a185ace51bd0dd480b234375a94ffa00f4ad74e46bbcdf907da7d9975595","observation_id":"e517d215-d6b7-45cc-b96d-efacca6aeec9","resolution":{"observed_at":"2026-08-06T21:47:15.695604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03229","last_updated":"2025-01-06T18:59:57Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2025-01-06T18:59:57Z","title":"Gaussian Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2501.03229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03229","snapshot_observed_at":"2026-08-06T21:47:14.067098Z","title":"Gaussian Masked Autoencoders","venue":"cs.CV","work_id":"658af24c-1df2-4788-b5d5-1a2df571d2a3","year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.040502Z"},"links":{"cited_paper":"/paper/2501.03229","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:0db2bdb17f69310c2bb43491f970376043d702abaf5ebd4669c731b464d41224","observation_id":"51ff19dd-a76a-45ab-9c72-8799982fd377","resolution":{"observed_at":"2026-08-06T21:47:14.169384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.442619Z","title":"Learning a classification model for segmentation","venue":null,"work_id":"3f713315-cc39-4e87-b2d7-e351889b5dda","year":2003},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.079031Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:46a5b35a62324b749775d21c065a4bd3534fe8fdff1ff2711ec41ad0d66002a8","observation_id":"326b0d3b-41f2-4a27-9b57-1129e725fce4","resolution":{"observed_at":"2026-08-06T21:47:15.493510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T21:47:13.101183Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.101183Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:f0be6939d203ce53591e26d891f0c219333db6e20701b0433a0e21285447bb8f","observation_id":"0836e8a5-4ef1-445b-bacb-576c6956ee30","resolution":{"observed_at":"2026-08-06T21:47:13.101183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.236255Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":"a4393ef4-01b7-45cf-b120-df9d42573a2b","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.151121Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:025f9c892f633332050b942e5b87046402a2f877348c06860b2bebb2c8df7d10","observation_id":"c0ea71a1-20eb-4917-9fc1-5c0ec8c287e8","resolution":{"observed_at":"2026-08-06T21:47:15.305740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.212064Z","title":"Superpixels: An evaluation of the state-of-the-art","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.212064Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:a54f17b5993fe07037065600d847175a349749be441649b8cbc22a61e2d2b99c","observation_id":"a4d8a551-bbbe-44e0-a939-83fbef92fc93","resolution":{"observed_at":"2026-08-06T21:47:13.212064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.048596Z","title":"Single-view view synthesis with multiplane images","venue":null,"work_id":"38ae34e1-72de-4af3-a77e-d6efd002d9e9","year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.236571Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:144c4b341dfa09d2fe2e0358705461f384828a809aebaee0da8dc882ebe13d40","observation_id":"5340c48a-b528-4227-a4de-b16e52df9857","resolution":{"observed_at":"2026-08-06T21:47:15.139091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.279370Z","title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.279370Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:71624aa3c7ec8d8b834f47fe378a45c41fe8f0a5f30a0c0db986f38d09823aeb","observation_id":"635841d9-9702-4ce9-8f0c-7eb7efbe101f","resolution":{"observed_at":"2026-08-06T21:47:13.279370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.354326Z","title":"Matching networks for one shot learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.354326Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:017112f06f4804ebec0fef723e960271104316c26ff23cf2d28cc033ebdf446b","observation_id":"ffd14c20-ccef-4ae2-ab4f-20b68397693d","resolution":{"observed_at":"2026-08-06T21:47:13.354326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.357382Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.357382Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9c4730e19e36a1acb3a0772facf6fd884f895467fd8633452c7668bbcc0bfa3e","observation_id":"e1d282c4-f13d-41c1-801a-ac2fb39a08f0","resolution":{"observed_at":"2026-08-06T21:47:13.357382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19155","last_updated":"2024-02-29T13:38:07Z","snapshot_observed_at":"2026-08-04T13:24:36.005929Z","submitted_at":"2024-02-29T13:38:07Z","title":"Beyond Language Models: Byte Models are Digital World Simulators","version":1},"cited_work":{"arxiv_id":"2402.19155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19155","snapshot_observed_at":"2026-08-06T21:47:13.964193Z","title":"Beyond Language Models: Byte Models are Digital World Simulators","venue":"cs.LG","work_id":"1baa0266-3be4-4ed7-bdbd-cfb5232d9e1e","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.372641Z"},"links":{"cited_paper":"/paper/2402.19155","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:18243ca668fa27415fa3ccd5428527838f2576bad1a905c70fc16620ed8ae384","observation_id":"06c8f80a-1f85-441c-86cf-7007377b6e37","resolution":{"observed_at":"2026-08-06T21:47:14.007426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.899910Z","title":"Learning in the frequency domain","venue":null,"work_id":"4db8146c-f845-4b9f-9f59-720912725ed3","year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.442882Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e2cca40393c5c55435fe6e23adb3a5db1720ad97e36fbf4f5d8ab9d071de59fb","observation_id":"5135e461-daef-48a1-bcdd-0af3d01951a0","resolution":{"observed_at":"2026-08-06T21:47:14.983179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.546287Z","title":"gsplat: An open-source library for gaussian splatting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.546287Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:97f51ac7e851389a04bd358f34c6774a81ca869df09effdb4249e07e7b4c3b51","observation_id":"c8e13307-e537-4105-9de6-390e916900c0","resolution":{"observed_at":"2026-08-06T21:47:13.546287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T21:47:13.608125Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.608125Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:ca5c316950ebf6fd30c87dfd7c3b2058618b95922e4a82a513cf6bd9a15423a4","observation_id":"3daf0d46-cb1e-448f-a58b-7f7da4af2f18","resolution":{"observed_at":"2026-08-06T21:47:13.608125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00173","last_updated":"2022-07-30T09:59:28Z","snapshot_observed_at":"2026-08-04T07:42:14.183883Z","submitted_at":"2022-07-30T09:59:28Z","title":"A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.00173","snapshot_observed_at":"2026-08-06T21:47:13.697596Z","title":"A survey on masked autoencoder for self-supervised learning in vision and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.697596Z"},"links":{"cited_paper":"/paper/2208.00173","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:5970607e0dd74002e4fc785fa29d8f569bee668abb8b76f992c4336caa1b04b9","observation_id":"ba8285a7-b6e8-454e-b4eb-2ab2b9d54e0a","resolution":{"observed_at":"2026-08-06T21:47:13.697596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.693453Z","title":"Gaussianimage: 1000 fps image representation and compression by 2d gaussian splatting","venue":null,"work_id":"0385e056-cf9c-411b-90a6-151234f25e74","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.794092Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9d29c84c290e7eb348fb4d1bf809c1d5545cafe58c67d5758629b6fd453a1bbb","observation_id":"8da1c4bd-7218-4bd1-8d90-9ac99f21af3d","resolution":{"observed_at":"2026-08-06T21:47:14.800213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.522916Z","title":"Self-supervised learning of object parts for semantic segmentation","venue":null,"work_id":"b04ca110-d3f5-4782-abe3-3e1cc61ea9b1","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.856071Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:b9ca69b8a8f7320484ef2fae3f59ff2b5305fdbd90664a3fe79dac6ebe54c83c","observation_id":"9d935b03-d3ab-47a7-9c6d-74efc9df2911","resolution":{"observed_at":"2026-08-06T21:47:14.591969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:01:13.321950Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.23532."}