{"as_of":"2026-08-09T05:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cad39ed7cca2496b5202a88eb3636bd4ce185b19e0b458bf0e19566a96f5e91b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:33:50.355434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":16,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T11:50:11.476015Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2106.08254"},"observation_digest":"sha256:c3fe1adabb357f306ac689c66dc3d6a01bf567cc723f439fefb04d3702de2614","observation_id":"14ddbe91-c3ed-47fe-9f7d-6bea1f796a44","resolution":{"observed_at":"2026-05-13T11:50:11.512076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T10:21:01.062199Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2111.02114"},"observation_digest":"sha256:481d6b829b78582a9d714684076d6b9565ecf86ebbac4ec1fcfe3260ea0a133c","observation_id":"1153f87d-0441-4cdb-bf5a-47a5f824de54","resolution":{"observed_at":"2026-05-12T10:21:01.108829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:f71dfa5bc442e29b50c240112b6bb7f99fd63c098212a12f9aec3cee3e900065","observation_id":"e0b35262-610b-473b-b275-7e8eaa5a55e4","resolution":{"observed_at":"2026-05-16T09:38:09.454541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:f520b8780b6e3bcab24b32d606c5d955e6286aacd4140af8c13651ce789a50ef","observation_id":"74d21f36-dd6b-4c4e-b66c-fdf1498937df","resolution":{"observed_at":"2026-05-12T04:22:30.491031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:832f2c1bd3f899d107e9836109c0ccf0fd23e69d87a65d5f697bb6bc13598068","observation_id":"b83230e8-7f76-4009-a14e-51caef88ada1","resolution":{"observed_at":"2026-05-13T14:22:17.095075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:2ecc0f22169b859ce6721a0a5e4ac16c03426441c72c784d6750f29cfb9109fa","observation_id":"614cd53c-7570-4844-80a3-6a848526af84","resolution":{"observed_at":"2026-05-13T14:22:17.464938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:293a1fd36c42694c704a54edfa4c446f67377b3457d2657aa10e5a5c2b9c9e4b","observation_id":"92127002-de8e-4a05-a473-dd172a74731b","resolution":{"observed_at":"2026-05-18T02:43:30.924882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:0076636b1dda1748b22a77cc2cd8866c690a32d7de2aa6d611418cd3ba158b94","observation_id":"4269597d-c48d-497b-b821-001dd2f2401f","resolution":{"observed_at":"2026-05-16T09:20:20.331713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:1db3fe4a7ffa35614ce7303caf6e0032c99f5809b8ac3642d38fb62b24290168","observation_id":"fb1c1f3c-d5c6-4727-9985-6ac941003fa6","resolution":{"observed_at":"2026-05-18T06:38:36.752601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:fc748bff335c8f2228058f04717f53952755fe4deb43ab003937431e15f0e174","observation_id":"f4e70d8f-82f7-4799-bd4a-24d5a05dced0","resolution":{"observed_at":"2026-05-13T17:30:03.073052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-06T18:33:50.355434Z","title":"Scaling vision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07931","last_updated":"2025-07-10T17:10:07Z","snapshot_observed_at":"2026-08-09T02:39:04.965663Z","submitted_at":"2025-07-10T17:10:07Z","title":"Meek Models Shall Inherit the Earth","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:33:50.355434Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2507.07931"},"observation_digest":"sha256:408f2df8b2d042e971b3bfccb51418f233d356f285a42264f3cb54633d67d06a","observation_id":"6f83608e-8c5d-49e2-a675-91ffe946fce0","resolution":{"observed_at":"2026-08-06T18:33:50.355434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T05:45:02.305660Z","title":"Scaling vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05019","last_updated":"2025-09-05T11:28:53Z","snapshot_observed_at":"2026-08-07T19:55:28.584270Z","submitted_at":"2025-09-05T11:28:53Z","title":"Leveraging Transfer Learning and Mobile-enabled Convolutional Neural Networks for Improved Arabic Handwritten Character Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:45:02.305660Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2509.05019"},"observation_digest":"sha256:08de3b7d2e971d5573fda983c08428adb836f98aaf63e809b5d64294c6efae10","observation_id":"0163c443-6e58-4dce-bd00-d9e31354a8fb","resolution":{"observed_at":"2026-08-05T05:45:02.305660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:19e41c83b6d92789957e9fa39c794013248dfb6aa6ea8bef9fb132ee875dd6e2","observation_id":"53def06e-9750-43f1-9a49-ef25c4f0591a","resolution":{"observed_at":"2026-05-17T20:25:11.529795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2601.10791","last_updated":"2026-05-04T15:47:57Z","snapshot_observed_at":"2026-07-06T22:41:53.823272Z","submitted_at":"2026-01-15T19:00:04Z","title":"OmniMol: Transferring Particle Physics Knowledge to Molecular Dynamics with Point-Edge Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T13:18:02.842399Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2601.10791"},"observation_digest":"sha256:fa457fe427e3682233b179bc748dc27ede8fa8634812a2ab146a585c86ae67a0","observation_id":"4fb82683-6f09-4a56-9820-5139d5d1d7c3","resolution":{"observed_at":"2026-05-16T13:20:57.963935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2604.03522","last_updated":"2026-04-04T00:03:54Z","snapshot_observed_at":"2026-07-30T03:45:35.005192Z","submitted_at":"2026-04-04T00:03:54Z","title":"Physics-Informed Transformer for Real-Time High-Fidelity Topology Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T17:18:39.261579Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2604.03522"},"observation_digest":"sha256:ff955ae7c92ad740dcc4311b1b75aff0da17990242ae8de5eff466fab8250a66","observation_id":"8749f0a9-4f03-4ae0-8c9d-f691bb07e530","resolution":{"observed_at":"2026-05-13T17:23:02.880853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2604.10021","last_updated":"2026-04-11T04:22:17Z","snapshot_observed_at":"2026-08-02T15:45:19.843637Z","submitted_at":"2026-04-11T04:22:17Z","title":"Masked Contrastive Pre-Training Improves Music Audio Key Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:33.210955Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2604.10021"},"observation_digest":"sha256:bed9e16dd463171a501aa0c75b98a87b860fcd914bfd55348ea7e5b3f5f1e81c","observation_id":"9df39a8b-521d-4c8b-b3df-1ba46dfd9ab9","resolution":{"observed_at":"2026-05-11T08:56:02.024344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2605.18058","last_updated":"2026-05-18T08:45:16Z","snapshot_observed_at":"2026-08-07T12:14:36.938931Z","submitted_at":"2026-05-18T08:45:16Z","title":"Threats to Arabic Handwriting Recognition: Investigating Black-Box Adversarial Attacks on embedded ConvNet models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:36.341683Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2605.18058"},"observation_digest":"sha256:a63d994ddfd319bf8691957d1db85c921212b99cf4f04c45fb9be73ae4b6054b","observation_id":"a558aaa5-e02f-41ac-a073-96bfc599dbd7","resolution":{"observed_at":"2026-05-20T11:38:14.686617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2605.23189","last_updated":"2026-05-22T03:17:14Z","snapshot_observed_at":"2026-08-08T16:05:13.996642Z","submitted_at":"2026-05-22T03:17:14Z","title":"Empirical Bayes Conformal Prediction for Vision and Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T04:45:11.816420Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2605.23189"},"observation_digest":"sha256:4dfe8b9c7505a4278a09e55d50ac3e9e6cba3d90a6e04126b8eba99340eeb0b9","observation_id":"cf687ffc-b345-4411-81ff-4f67edc3cdd4","resolution":{"observed_at":"2026-05-25T04:45:19.791831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2605.26248","last_updated":"2026-05-25T18:15:27Z","snapshot_observed_at":"2026-08-05T12:04:21.559242Z","submitted_at":"2026-05-25T18:15:27Z","title":"Unified Neural Scaling Laws","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:43.393302Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2605.26248"},"observation_digest":"sha256:1957ad775750d57bbcf5f425c4e627203cd3d219df3a4644d7d5a45891680fd6","observation_id":"96e3459a-788e-4879-b74a-317410fee9eb","resolution":{"observed_at":"2026-06-29T23:44:03.336396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2606.02794","last_updated":"2026-06-01T18:59:01Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:59:01Z","title":"Scaling Laws for Neural-Network Quantum States","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:30:23.893472Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2606.02794"},"observation_digest":"sha256:b041524a44ae586ef4afbe0527ee00ac175f944cae4c188dbe948a5427a0a264","observation_id":"6d85e87a-bf31-43d4-ab60-53873f257dde","resolution":{"observed_at":"2026-07-02T01:46:27.100672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:ee9df67286709a9403d51d0d10b0f7e6b8a54da946405a04c70bf4ae5fab30e7","observation_id":"e394515f-5dc5-40e8-acf1-0eaf6969930e","resolution":{"observed_at":"2026-07-04T20:30:07.801562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-02T10:14:13.365487Z","title":"Scaling vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:13.365487Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:6447a32a352ed139dc195481adf7fbbe6197023de74ae86ab108f53e4da964fa","observation_id":"52cbf837-3f41-4fe9-a848-0d1845e5fc5d","resolution":{"observed_at":"2026-08-02T10:14:13.365487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-07-30T12:53:40.706869Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.706869Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:f948fef2504bfc5af9d56fd3c4a4ee5372c525152008290b85089ec9aa5dcd79","observation_id":"55b13f6c-2c76-4e87-b39a-92a8567d0e1e","resolution":{"observed_at":"2026-07-30T12:53:40.706869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.04560/citation-record","integrity":"/paper/2106.04560/integrity","json":"/paper/2106.04560/citation-record.json","paper":"/paper/2106.04560"},"outbound":[],"paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:10:17.430115Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2106.04560."}