{"as_of":"2026-08-09T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d23a5cae9d237af72740d9ecca7ac30796761ef2e4101e5c8088123aaec39ab","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:51:14.747270Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23357/citation-record","integrity":"/paper/2507.23357/integrity","json":"/paper/2507.23357/citation-record.json","paper":"/paper/2507.23357"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.141624Z","title":"Bert: A sentiment analysis odyssey","venue":null,"work_id":"aa2049b5-60c4-481e-a123-a0c3c07ab2ac","year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.631679Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:79adad58ebf85a25338105f16f21985d3cb3218abd32ef0bffdbc9a15867df8c","observation_id":"e960b0b2-0678-40a9-85da-2c01e711ebb6","resolution":{"observed_at":"2026-08-06T10:51:15.145215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T10:51:14.635637Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.635637Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:fb497fdaaa038261f55c9baee2f0993519d41207d943ec4a98136178db153a38","observation_id":"20652faa-4713-4dfc-9236-5ad372d13093","resolution":{"observed_at":"2026-08-06T10:51:14.635637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.131112Z","title":"Large scale gan training for high fidelity natural image synthesis, 2019","venue":null,"work_id":"95c616d7-ced4-47fd-97c7-4c12bec94f58","year":2019},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.639394Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:98e019748c64c8e56fff6fdf4366ee395606b9ad62b0fc7cb2d962578f937405","observation_id":"711c5f5e-e939-40f3-b9b4-f89bea023d55","resolution":{"observed_at":"2026-08-06T10:51:15.134693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.119798Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"52070be5-051e-41b5-b342-1f426fb15240","year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.642956Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:915fecbae885145e4eb2ac7c03db0ac5f7184d3ce3dfd7db31146b33bfa960bf","observation_id":"263473b8-8639-41ed-bf36-b2d8b6b923c7","resolution":{"observed_at":"2026-08-06T10:51:15.123186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.646602Z","title":"A simple framework for contrastive learning of visual representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.646602Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:1174bc697f70ad972313215a5f557dbea769747b6e2ecc3857aa4e25b2e187cc","observation_id":"e0fb7093-b882-47ff-b633-a0316b77ea0f","resolution":{"observed_at":"2026-08-06T10:51:14.646602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.101129Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":"b0504775-5f1d-4927-b1de-a16aa30d4263","year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.649905Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:64418b1e42e71fadc2006410253d8a35e6e9c685fd0cee346de676947f891c79","observation_id":"ccefa1f0-114e-464a-b5e7-8e0fdd6c7e06","resolution":{"observed_at":"2026-08-06T10:51:15.105078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00389","last_updated":"2022-06-01T10:41:11Z","snapshot_observed_at":"2026-07-06T13:16:20.721431Z","submitted_at":"2022-06-01T10:41:11Z","title":"A comparative study between vision transformers and CNNs in digital pathology","version":1},"cited_work":{"arxiv_id":"2206.00389","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00389","snapshot_observed_at":"2026-08-06T10:51:14.808740Z","title":"A comparative study between vision transformers and CNNs in digital pathology","venue":"eess.IV","work_id":"9c3ddcef-4c26-4d37-a9fc-084e07d74523","year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.653749Z"},"links":{"cited_paper":"/paper/2206.00389","citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:c57dee53da3b95a462fe6bbd863738f5d28da4780e7ac21daf14a86b38a425f4","observation_id":"029ea3a6-6b55-4671-baed-e9c3bc1a42f5","resolution":{"observed_at":"2026-08-06T10:51:14.815839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.090280Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"0beb7433-eaf6-415e-93da-955c99c13235","year":2019},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.657062Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:3f2d2312f26c93dd3575477caceba85a870c326af42f3c8f8d26a863f30ccdaf","observation_id":"638cca09-1c17-4a17-850e-8d3519542692","resolution":{"observed_at":"2026-08-06T10:51:15.093836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.079747Z","title":"Gan vs transformer: A generative ai comparison, June 2025","venue":null,"work_id":"2e695a92-5a62-4c07-a837-9eb54d802b35","year":2025},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.660071Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:5b63f0f4d6bfd609a5c2608640dd76f1a0d5094de064a0b5988ddc9a1a0913b2","observation_id":"1355d3e7-dad7-4c92-a68f-3326be143c4e","resolution":{"observed_at":"2026-08-06T10:51:15.083137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T10:51:14.663186Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.663186Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:8308b17ecabd1a1a6ee4c5b739afa48813589fef611415813e6f0a721414e263","observation_id":"8e0f864a-d53c-4b3d-8b55-e7cbc53d3124","resolution":{"observed_at":"2026-08-06T10:51:14.663186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.069103Z","title":"Generative adversarial nets","venue":null,"work_id":"c736f624-5e6b-47e6-89f6-e7b6f6dbcf1a","year":2014},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.666631Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:78ac7c0f5fab914c9de8f2f1d5e6339a02a2fe637288fbb0db37b264e8ec647b","observation_id":"1cb4ffd6-78ec-47f7-8fdf-1af7c866873f","resolution":{"observed_at":"2026-08-06T10:51:15.072329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.058811Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"559cec04-bc80-4de7-9e46-8a21d5a26024","year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.669744Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:4f3b4117be579a3e075fab77095abf45c334c435482143626f45cddfe98280e7","observation_id":"19635cb2-cb0a-4f25-9674-00042f0b40ff","resolution":{"observed_at":"2026-08-06T10:51:15.062191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.048237Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"5ae13c7c-7bb4-4eec-832f-0067c84af5f6","year":2020},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.672912Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:e42c8e1a8ad3a58bc7ac7f5540f46ab419a52660bacdb244245fee5cea249432","observation_id":"5a34140d-2ab6-47be-a178-0bd0909040c3","resolution":{"observed_at":"2026-08-06T10:51:15.051729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.675864Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.675864Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:492be934801127c5ab37327f75f1a209d74ea14e186a515782737c9c549fcebf","observation_id":"6cbb7dae-c2b7-4823-93f9-6b7663f22fcc","resolution":{"observed_at":"2026-08-06T10:51:14.675864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.678891Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.678891Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:597c9caac6766cf1c245c7f7ff58d7e8ae8a9b752ca36db71f497fe4126d86f9","observation_id":"299c23a9-2ac3-4e85-9b1d-8446d0243524","resolution":{"observed_at":"2026-08-06T10:51:14.678891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.681746Z","title":"Denoising diffusion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.681746Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:ad53962821d1c99f32d97b6db8bf6de5b7aea63f2165b39a522aaa6a36459b61","observation_id":"0f653243-f64e-4f1b-8bc3-ae8aa29b4529","resolution":{"observed_at":"2026-08-06T10:51:14.681746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:15.016497Z","title":"Long short-term memory","venue":null,"work_id":"eddb8629-6127-433f-9b3f-aafce3fdf371","year":1997},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.684893Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:626104ffc4ab9ba046dfe9bcffef6b9a9a04698c1887ec1eb45b0a720b9bff1c","observation_id":"14306e41-0737-4227-b47d-3526c1054e8a","resolution":{"observed_at":"2026-08-06T10:51:15.019904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.687780Z","title":"Progressive growing of gans for improved quality, stability, and variation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.687780Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:d7444ff99c422ec3785afe2820bde4a81f9262289b096f07d8a1f513772bfc63","observation_id":"1cf4f943-244f-4609-a989-63c440943b9f","resolution":{"observed_at":"2026-08-06T10:51:14.687780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.998052Z","title":"Big transfer (bit): General visual representation learning","venue":null,"work_id":"416a84e5-6571-4479-9b38-e82de00ddc0b","year":2020},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.690727Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:25e9da1e25306fd5dff046a5cffe8a26aaa3258a8a9b799482fc0a926da17cf6","observation_id":"e07963d0-ca32-491d-a0d2-bbdd8d522d2e","resolution":{"observed_at":"2026-08-06T10:51:15.001717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.986812Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":"d1045e82-1f21-4c81-bd24-569b2244807e","year":2012},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.693829Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:5ac326bbc184ee79b0054bf08b4c78d0b388de2dd000709a88739adc20be7a5a","observation_id":"cd88bc7a-a3de-4053-be60-ad92b40c5925","resolution":{"observed_at":"2026-08-06T10:51:14.990245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.975967Z","title":"Efficient self-supervised vision transformers for representation learning, 2022","venue":null,"work_id":"e85a480c-7ad8-482e-9568-39f516e9a229","year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.696893Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:c936c01643fc977715e89feaedd0dfb0588f51485b55c298fea3f0b3b90cb174","observation_id":"c7c9d4d5-091d-47a8-949c-c84ccc167c7c","resolution":{"observed_at":"2026-08-06T10:51:14.979361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.964684Z","title":"Microsoft researchers win ImageNet computer vision challenge","venue":null,"work_id":"ac9bc54f-d204-4da1-b24b-cc44a5f832c0","year":2025},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.699938Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:493da7d7cada8933a6c1eb60745311d212cd0a6bfd7623d1bdc0af1b7f8103c8","observation_id":"c18b47f1-8d98-4b30-bcaf-bd5585f74019","resolution":{"observed_at":"2026-08-06T10:51:14.968181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.703089Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.703089Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:4890a36616a93a36e815321991adf3ffa234012ee7efcbd20f2829b494f5a81f","observation_id":"5605c68b-1028-4145-abe1-e6881f6028c1","resolution":{"observed_at":"2026-08-06T10:51:14.703089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.946292Z","title":"ChatGPT, 2025","venue":null,"work_id":"4f1f4136-d646-4bb5-b73d-ca5ccff0bb40","year":2025},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.706213Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:74bfcb60cb7a530ffe374cf2aa3f78abff84ab29b930521b109d121f7595d526","observation_id":"c0f4b0e4-67fe-4bcc-96e4-6c51d4c923a2","resolution":{"observed_at":"2026-08-06T10:51:14.949974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.934387Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":"88e1140e-bfc6-4286-acf0-f261752cc4c9","year":2024},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.709123Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:b7a39a1cdd85ac8bb2b7313a7f7ea5a1acf01df00fb894d2695f18eaf6af0c76","observation_id":"9d1a5e7f-8b94-4e34-91fb-224fd56d1df6","resolution":{"observed_at":"2026-08-06T10:51:14.938299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.923337Z","title":"High-resolution image syn- thesis with latent diffusion models, 2022","venue":null,"work_id":"7bd232c6-7d93-4fb4-9672-9c9d9af345c4","year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.712173Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:1cd7221740995bc76ed932ad7a8b70a6f01234e9e03fb53a634a6676baf0fc1e","observation_id":"f46df5e4-88df-43f3-b50f-260786c38a98","resolution":{"observed_at":"2026-08-06T10:51:14.927057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.913028Z","title":"Emre Celebi, and Jie Yang","venue":null,"work_id":"f56cdb68-3196-4d38-93ac-9ca903721e11","year":2020},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.715123Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:ad3f5307a6ec876c183fc59244a131575355d9600b47cdb08158a58368e38680","observation_id":"e9b86369-8072-41d2-8a46-ff350d75e965","resolution":{"observed_at":"2026-08-06T10:51:14.916166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.902020Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"ee909cd0-802f-447d-84a4-4bddf2d34fcb","year":2014},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.718315Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:1de79ac51c4f4635005a0736411354fbca42fdb00381e7dd07a92fc54610c9ae","observation_id":"60ff6a0c-40f9-4596-bfa6-af93b284b796","resolution":{"observed_at":"2026-08-06T10:51:14.905693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00387","last_updated":"2015-11-03T18:15:15Z","snapshot_observed_at":"2026-07-06T04:16:46.012738Z","submitted_at":"2015-05-03T01:56:57Z","title":"Highway Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00387","snapshot_observed_at":"2026-08-06T10:51:14.721314Z","title":"Highway networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.721314Z"},"links":{"cited_paper":"/paper/1505.00387","citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:beb390bd073331a08e6b678737cca35454bd7e30ac85f792ab65fbb6ed7d20c3","observation_id":"e1bdfea2-d705-4326-a585-5ae2f5501f12","resolution":{"observed_at":"2026-08-06T10:51:14.721314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.891288Z","title":"Going deeper with convolutions, 2014","venue":null,"work_id":"deca8d71-8fb0-4ea1-a09b-bd7cedecd2de","year":2014},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.724359Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:975cb3c6a0f9138f9c4fcc2f57893f442873118d4bc106b47eb6b91fd0f34a92","observation_id":"9617e776-6c76-4463-9310-36aedfc8f55e","resolution":{"observed_at":"2026-08-06T10:51:14.895071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07197","last_updated":"2021-07-01T11:55:07Z","snapshot_observed_at":"2026-07-06T11:09:41.435966Z","submitted_at":"2021-05-15T10:33:35Z","title":"Are Convolutional Neural Networks or Transformers more like human vision?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07197","snapshot_observed_at":"2026-08-06T10:51:14.728876Z","title":"Are convolutional neural networks or transformers more like human vision? arXiv preprint arXiv:2105.07197, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.728876Z"},"links":{"cited_paper":"/paper/2105.07197","citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:43a66bf2069c3945ccffddbe3e39a562ff25752204c79dbd3f2a14947fe12c73","observation_id":"e8f01e71-959c-41dd-b787-3174463ef6a9","resolution":{"observed_at":"2026-08-06T10:51:14.728876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.880962Z","title":"Attention is all you need, 06 2017","venue":null,"work_id":"5950b454-54c1-4d50-91d1-0ad30b883065","year":2017},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.732142Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:073c18b0b0d639d604d279a9d72d3175eb3d24119e410c620f4c3750f558fc31","observation_id":"0ce3e0c4-8ca8-4943-9505-4b07d85ad397","resolution":{"observed_at":"2026-08-06T10:51:14.884159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.734982Z","title":"Non-local neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.734982Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:0ca073deedad5d5f922f0aae8caffbf9eebe2c6ea6a91592835ab6e81a848322","observation_id":"4cee86e2-df01-4e94-9f85-741a86dc9817","resolution":{"observed_at":"2026-08-06T10:51:14.734982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.737938Z","title":"Scaling vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.737938Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:6926dc6a195052217f960723ed475b9607641d1af8c7761c6f8b1afb54be1b32","observation_id":"50dcfb43-023a-4727-83c4-8007a3746ca8","resolution":{"observed_at":"2026-08-06T10:51:14.737938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.856705Z","title":"Progressive augmentation of gans, 2019","venue":null,"work_id":"19f52b4b-fbf9-4d16-a89b-e7889ab67a2d","year":2019},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.740897Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:c3c57f2842d7bb4348fc970bb33082a84e07ad24a4d11159a01fe08bd6dc85ee","observation_id":"834546d5-2f8c-4323-b145-0b15fc93f155","resolution":{"observed_at":"2026-08-06T10:51:14.860057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.845776Z","title":"Energy-based generative adversarial network, 2017","venue":null,"work_id":"24130972-b7d2-4cb1-b345-2d5d7ca32fa0","year":2017},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.744042Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:53a196d7a9c907f745507fdee719117228a12fdd74726f2b2169f562a27ad4f3","observation_id":"9ad4e720-5a32-4c80-b538-071e4ae78e10","resolution":{"observed_at":"2026-08-06T10:51:14.849184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:51:14.834548Z","title":"ibot: Image bert pre-training with online tokenizer, 2022","venue":null,"work_id":"dcafeb69-3e2c-4971-8ca8-f1a17980770a","year":2022},"citing_paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:51:14.747270Z"},"links":{"citing_paper":"/paper/2507.23357"},"observation_digest":"sha256:d3961b3f34590a703d8347db9c2b2d0be9cf117adc7a2637335ba976fc3e1848","observation_id":"3ca1db25-c80a-43a2-8acd-8f69d73e085e","resolution":{"observed_at":"2026-08-06T10:51:14.838267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23357","last_updated":"2025-09-04T07:47:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:10:02.454584Z","submitted_at":"2025-07-31T09:08:11Z","title":"Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.23357."}