{"as_of":"2026-08-08T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b89979cebdbac404c96f1da999ecf45c35b23264773380b8948b5b713a99ec3","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:13:45.726694Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.17950/citation-record","integrity":"/paper/2601.17950/integrity","json":"/paper/2601.17950/citation-record.json","paper":"/paper/2601.17950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-03T08:13:39.096797Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions.arXiv preprint arXiv:2303.08797,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.096797Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:54f7af6d91bb4d18d6c9aae7eda62dd57c267b83d2282a7484f4a340cde7bd89","observation_id":"6aecd654-3a04-427c-b642-76efc27b4a9a","resolution":{"observed_at":"2026-08-03T08:13:39.096797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-07T13:01:28.667448Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-03T08:13:39.247257Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.247257Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:6e0110c935abd7e99d513432de7feb73c259845b61c3bd04d5d7d80552122cf9","observation_id":"d9fc5d41-16d8-4161-9084-f14b8de71451","resolution":{"observed_at":"2026-08-03T08:13:39.247257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-03T08:13:39.401846Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.401846Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:d15542aa3e517585514adec8c50fbe0d628113dfbb7ebe22b0e5596cc7709cb9","observation_id":"0ffb985b-7654-4d14-9ed5-db3483e2cc7e","resolution":{"observed_at":"2026-08-03T08:13:39.401846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:39.585754Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.585754Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:5b640276ec835dd199ae48bd621a1f17cac6d28875d2c6a9043cc3d154d52894","observation_id":"1a953ff9-2116-4f56-aced-80e6337d3311","resolution":{"observed_at":"2026-08-03T08:13:39.585754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-03T08:13:39.716979Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.716979Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:94497fc417f3dfc21588c575a1c7d02a3bd7ab48fa1070e3995efba435887f39","observation_id":"b7340b56-660c-4ff3-9945-c4ca5dbbde67","resolution":{"observed_at":"2026-08-03T08:13:39.716979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:39.839045Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.839045Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:3149be9293a5383413e36b1023f4bf09e298678f1931cfdea571a99ea4c8b152","observation_id":"821185a5-88dc-4645-93bb-5b6fb352bc0a","resolution":{"observed_at":"2026-08-03T08:13:39.839045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:39.976234Z","title":"Fsrnet: End-to-end learning face super-resolution with facial priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.976234Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:6b891ce8ca10eacb6a1087ffbde3535813f31c764f6a520cb350bdc5a121f068","observation_id":"7e71d1a2-2584-4b4a-adff-8aa328e4c1a6","resolution":{"observed_at":"2026-08-03T08:13:39.976234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.198819Z","title":"Learning continuous image representation with local implicit image function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.198819Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:417c7bc35eb8f42b030b438bb044ce706eaa88d3268b7c70a619241df4d81fb2","observation_id":"7f45d0e8-f666-49aa-8fe0-4d454a9f53a2","resolution":{"observed_at":"2026-08-03T08:13:40.198819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.285336Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.285336Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:4a260e10017314f47f521466f63cc3df725f88c0f42775e3498e843dd54b754d","observation_id":"6123228e-c22a-4e1e-bd26-102ba71883f0","resolution":{"observed_at":"2026-08-03T08:13:40.285336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.348535Z","title":"Jafar: Jack up any feature at any resolution.arXiv preprint arXiv:2506.11136, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.348535Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:c89635b47405bb7d5103d8d89d54949309fee5a22454f617d4ddd56b046fc3b6","observation_id":"3424be39-1bdd-489d-90c7-a0529393ebd7","resolution":{"observed_at":"2026-08-03T08:13:40.348535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.442771Z","title":"Pixel recursive super resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.442771Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:6758d8dd441dc0f6bb7a51f7af4ebb0715f1a34bec4cebdcdc70504713be8c9d","observation_id":"513152f8-ab69-492f-a5b7-88ce9d535b65","resolution":{"observed_at":"2026-08-03T08:13:40.442771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.518158Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.518158Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:015f4bd9c3e1bb52d47aa321085526057d1d277a2debf4894a1bdb46c6ca5d6d","observation_id":"a4e938fb-6c1a-4dae-9c17-cd2564e04f8b","resolution":{"observed_at":"2026-08-03T08:13:40.518158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T08:13:40.597227Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.597227Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:55899e69bcd425baf35b167cb369bd204485d9e635f8569e129d2976c6e7d898","observation_id":"05ecc0a7-29bf-45be-9e54-42fb4cf62626","resolution":{"observed_at":"2026-08-03T08:13:40.597227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:40.736508Z","title":"The pascal visual object classes challenge: A retrospective.Inter- national journal of computer vision, 111(1):98–136, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.736508Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:2c6e8f30a2793af444135ce2876f5101df4d89264a4691cde9ed4de8845c8e1c","observation_id":"c7def0b2-68dd-426f-b377-f1ba53291699","resolution":{"observed_at":"2026-08-03T08:13:40.736508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10516","last_updated":"2024-04-01T20:57:45Z","snapshot_observed_at":"2026-07-06T17:45:23.748539Z","submitted_at":"2024-03-15T17:57:06Z","title":"FeatUp: A Model-Agnostic Framework for Features at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10516","snapshot_observed_at":"2026-08-03T08:13:40.867249Z","title":"Featup: A model- agnostic framework for features at any resolution.arXiv preprint arXiv:2403.10516, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:40.867249Z"},"links":{"cited_paper":"/paper/2403.10516","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:9e22bfaf77b37494a9f81c435b3e4ca29ef0b900995cbe57fce4991ac9b27dd4","observation_id":"6a445f60-1006-43c8-89fb-d46bd8209fde","resolution":{"observed_at":"2026-08-03T08:13:40.867249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.015793Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.015793Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:ccf96caf9decc0b737a436d9ee684f8e515d11926144aaea343ee58e0d32b31b","observation_id":"2a02c920-b7dd-46cc-ac2b-929e1d9f1c09","resolution":{"observed_at":"2026-08-03T08:13:41.015793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.124540Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.124540Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:92f745aeb0314d6113ea4e27203c1dd4d3887c2068f1ff9c7de34da5566c3ae7","observation_id":"893b2d6a-d499-48bf-b7cb-a921771f07ef","resolution":{"observed_at":"2026-08-03T08:13:41.124540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14032","last_updated":"2025-04-18T18:46:08Z","snapshot_observed_at":"2026-08-07T16:01:01.943443Z","submitted_at":"2025-04-18T18:46:08Z","title":"LoftUp: Learning a Coordinate-Based Feature Upsampler for Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14032","snapshot_observed_at":"2026-08-03T08:13:41.230471Z","title":"Loftup: Learning a coordinate- based feature upsampler for vision foundation models.arXiv preprint arXiv:2504.14032, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.230471Z"},"links":{"cited_paper":"/paper/2504.14032","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:9b03befb38e49df202410d3a3f7a2355df532399aae2803ebad784deaf61ecf1","observation_id":"7fad0f2a-d470-45f4-aa9d-30d5c9227b70","resolution":{"observed_at":"2026-08-03T08:13:41.230471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01709","last_updated":"2024-04-02T07:49:08Z","snapshot_observed_at":"2026-07-06T17:54:23.918329Z","submitted_at":"2024-04-02T07:49:08Z","title":"Upsample Guidance: Scale Up Diffusion Models without Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01709","snapshot_observed_at":"2026-08-03T08:13:41.379766Z","title":"Upsample guidance: Scale up diffusion models without training.arXiv preprint arXiv:2404.01709, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.379766Z"},"links":{"cited_paper":"/paper/2404.01709","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:6e5218b9d4fb756a0f11c6270c241644cdd1ce594a870d3444db5ac1bc24c76e","observation_id":"66726763-3927-4013-9c30-f4152edf8f83","resolution":{"observed_at":"2026-08-03T08:13:41.379766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.520400Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.520400Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:bf226c5c91d8d09dbab44f89ed8f67b726f0343933804ff8bf6ed6a4b6c988c9","observation_id":"e5d9c67a-0192-4ec2-8da4-9da8dc40bf05","resolution":{"observed_at":"2026-08-03T08:13:41.520400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-03T08:13:41.674231Z","title":"Auto-encoding varia- tional bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.674231Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:68fbe30cb7319d4c8f0beaef4f222a9ced6e4427d98faf5c5c5aecfcbd46fa18","observation_id":"03ec13c6-8c2e-46d4-97db-fa7f3c164db0","resolution":{"observed_at":"2026-08-03T08:13:41.674231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.748602Z","title":"Joint bilateral upsampling.ACM Transactions on Graphics (ToG), 26(3):96–es, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.748602Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:787da547c621efc8b2ceb9cc288094144de8c2de8dae115046bd862022e749ff","observation_id":"b7077177-f56c-4c26-9629-87295c1286ee","resolution":{"observed_at":"2026-08-03T08:13:41.748602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.854450Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.854450Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:034509a32cca0a4a75993e4631a7bc546044ea7699e9d2bc56f0cbc9a70be6bf","observation_id":"85e449d5-2d1f-4690-9a29-38b1f89ca2a6","resolution":{"observed_at":"2026-08-03T08:13:41.854450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:41.976889Z","title":"Photo- realistic single image super-resolution using a generative ad- versarial network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:41.976889Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:a905a7be6b9215c2fe609e77606b4f7b4229b9926b3418048a029b5bb89775f5","observation_id":"cf6b4660-94d4-4e77-87fa-2422df4d567d","resolution":{"observed_at":"2026-08-03T08:13:41.976889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06163","last_updated":"2024-12-09T02:51:24Z","snapshot_observed_at":"2026-07-31T12:05:32.422413Z","submitted_at":"2024-12-09T02:51:24Z","title":"ASGDiffusion: Parallel High-Resolution Generation with Asynchronous Structure Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06163","snapshot_observed_at":"2026-08-03T08:13:42.138653Z","title":"Asgdiffusion: Parallel high-resolution generation with asynchronous struc- ture guidance.arXiv preprint arXiv:2412.06163, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.138653Z"},"links":{"cited_paper":"/paper/2412.06163","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:741bc64762d392b4bc06c8db6790255bbc23f0e18b4113fd09020b6e7b8e0654","observation_id":"51031ae7-78bf-468e-9f1d-a52641c0ef06","resolution":{"observed_at":"2026-08-03T08:13:42.138653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:42.279826Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.279826Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:5dd6fefad7b7b0b6e6a863947876010124850886f6720d86a02ea146fd348e08","observation_id":"4368d641-2dd6-40d1-9a6e-478dc6fa286a","resolution":{"observed_at":"2026-08-03T08:13:42.279826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:42.391606Z","title":"Accdiffusion v2: Towards more accurate higher-resolution diffusion extrapolation.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.391606Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:d43d841d92bf28119eef26a542ef43c1a3adbd0ba4b337e4cc491b670c470776","observation_id":"615e72f6-cf68-481b-a870-327dd984f663","resolution":{"observed_at":"2026-08-03T08:13:42.391606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T08:13:42.472561Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.472561Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:b6e9aaa2234d58b0e71588cb105c507d7d831543d9d2fb8287ff916a6bbbeae4","observation_id":"fa274487-60bb-4023-98af-57569f6c3463","resolution":{"observed_at":"2026-08-03T08:13:42.472561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:42.575786Z","title":"Learn- ing to upsample by learning to sample","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.575786Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:f996b3dd24a659c8090cec5be95694d0f1bde3688d3557125b74661db352731d","observation_id":"2548fd70-af81-4d3d-8013-e4deb759ae2d","resolution":{"observed_at":"2026-08-03T08:13:42.575786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T08:13:42.828988Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.828988Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:29ad24ba2a9b5ee66f9a071663b004946e57d27dd5f449c87a28f3ed389d024a","observation_id":"14bed1ad-4413-4baa-a022-cc905c725757","resolution":{"observed_at":"2026-08-03T08:13:42.828988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:42.960369Z","title":"Sapa: Similarity-aware point affiliation for feature upsampling.Advances in Neural Information Pro- cessing Systems, 35:20889–20901, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:42.960369Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:9127f4e9856e4ec602837b12a4bbdd46e8ed39b8a1f7239eb84e27675f3c92b3","observation_id":"f479e434-6fbb-4be4-93ab-2c24cde2a5b6","resolution":{"observed_at":"2026-08-03T08:13:42.960369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05556","last_updated":"2023-11-09T18:04:15Z","snapshot_observed_at":"2026-07-06T16:45:20.005195Z","submitted_at":"2023-11-09T18:04:15Z","title":"LCM-LoRA: A Universal Stable-Diffusion Acceleration Module","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05556","snapshot_observed_at":"2026-08-03T08:13:43.048470Z","title":"Lcm-lora: A universal stable-diffusion acceler- ation module.arXiv preprint arXiv:2311.05556, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.048470Z"},"links":{"cited_paper":"/paper/2311.05556","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:371287522015afd6332dc05e5e6dc157e350d4227e09df6fb52a6b28afd991a0","observation_id":"3bea0033-bd96-400f-bbf3-6df7950f5d56","resolution":{"observed_at":"2026-08-03T08:13:43.048470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.133215Z","title":"Pulse: Self-supervised photo upsam- pling via latent space exploration of generative models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.133215Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:1cee6ba32c244402bb4ea82d40cef83157e2397f7072906b61a62915616ebcde","observation_id":"bb44b3d8-57ba-4308-abce-c08ebb22a90d","resolution":{"observed_at":"2026-08-03T08:13:43.133215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T08:13:43.228383Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.228383Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:f70a487548d6aab138c1f23e3c68f4b9886bb9c282c00b700d748d64d81c7163","observation_id":"689ace01-31b8-4c19-9ce2-c98e81d37848","resolution":{"observed_at":"2026-08-03T08:13:43.228383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T08:13:43.321397Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.321397Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:f65ceba7fe3d727ec6f796ae3d918b06f17fa2a8342a92ae0ff2fd601ea6eefa","observation_id":"a6f763ce-588d-4821-b5c9-1d50068c6bda","resolution":{"observed_at":"2026-08-03T08:13:43.321397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.409284Z","title":"Freescale: Unleashing the resolution of diffusion models via tuning-free scale fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.409284Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:1420abd2038c6d4194b77f8a1fe0f88fd87fb54f8a759338d747a77e2e59b422","observation_id":"985ff78f-4b39-4da1-b51a-0b34a0800123","resolution":{"observed_at":"2026-08-03T08:13:43.409284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.522515Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.522515Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:1560f5c498d3b27ffa83c23d833503cf1119bc7c25106833d34fa21f3c1d9431","observation_id":"7158cca1-fe79-4fd6-95f2-4277f7d1d401","resolution":{"observed_at":"2026-08-03T08:13:43.522515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.678607Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.678607Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:5733209f22e93272032f99c782189f3c295776510f94dfeef1a36557c387d9e0","observation_id":"a882ecad-eef9-4613-9988-24961ae8924a","resolution":{"observed_at":"2026-08-03T08:13:43.678607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.839210Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.839210Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:522785d027475aec9b41a99d8c822fda446bd11d1dedfcc2551b136a9e78f8d4","observation_id":"ce6e6387-2aec-402f-ab58-4db3ade99951","resolution":{"observed_at":"2026-08-03T08:13:43.839210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:43.890272Z","title":"Image super- resolution via iterative refinement.IEEE transactions on pattern analysis and machine intelligence, 45(4):4713–4726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:43.890272Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:e173da9d7495f73f0bc7d16cdbc7ff42bb23c619de5123983587283a0adeaf34","observation_id":"972bf6b0-88b7-41b2-8c42-f0d97c8ed91a","resolution":{"observed_at":"2026-08-03T08:13:43.890272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:44.055645Z","title":"Fmboost: Boosting latent diffusion with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.055645Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:39637717fa3688964454c624da1ce382395ae2c3282e9cec057d8c2f34f0112e","observation_id":"17e8011d-53b4-4b3f-9aca-ffd32cee73af","resolution":{"observed_at":"2026-08-03T08:13:44.055645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T08:13:44.241700Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.241700Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:a0b6b1244ec21d9550acc686949ada3b8cdc019f95c8573e80b35768032d01df","observation_id":"826a8c7d-4e84-4393-8a75-a7a3228fc8b9","resolution":{"observed_at":"2026-08-03T08:13:44.241700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:44.362205Z","title":"Lift: A surprisingly simple lightweight feature transform for dense vit descriptors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.362205Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:38a4e074fd66ca78db7b083a65ef334f5e20bf2145d93bc2994d806d80b117d1","observation_id":"7d593c30-0bec-44b7-a844-f16543b8ddcd","resolution":{"observed_at":"2026-08-03T08:13:44.362205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07251","last_updated":"2024-10-24T12:31:09Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T13:33:33Z","title":"Is One GPU Enough? Pushing Image Generation at Higher-Resolutions with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07251","snapshot_observed_at":"2026-08-03T08:13:44.475580Z","title":"Is one gpu enough? pushing image generation at higher-resolutions with founda- tion models.arXiv preprint arXiv:2406.07251, 2(3):5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.475580Z"},"links":{"cited_paper":"/paper/2406.07251","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:7730700e2adbf872a2e0b157112ad678a189a8ba6bb7dedca134735d51d9bbc5","observation_id":"a661e152-786f-4ad6-87eb-bf55b20a7369","resolution":{"observed_at":"2026-08-03T08:13:44.475580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-03T08:13:44.598408Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.598408Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:419aa0ebcba8df854312fa7e9811e5482c136c6ef272e8311bdb17fa802d6f1c","observation_id":"63c28ab0-704d-40ea-bc44-dd7b51c6dcab","resolution":{"observed_at":"2026-08-03T08:13:44.598408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:44.711890Z","title":"Unsplash Full, Lite Dataset 1.3.0, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.711890Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:01685e8f0f92788e59d80ba255082f2c9c7a2506c11be0f6b7a360f528226934","observation_id":"e6b04479-1029-49ec-9219-3baabd87c9ce","resolution":{"observed_at":"2026-08-03T08:13:44.711890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:44.863922Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.863922Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:87caf6798860f1b1cf3b7dacdec418572a76a109725f234e9f19d43b1a344f77","observation_id":"61fa6b2e-ed41-4df2-8894-090b1bbd3456","resolution":{"observed_at":"2026-08-03T08:13:44.863922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:44.995598Z","title":"Teaching matters: Investigating the role of supervision in vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:44.995598Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:8bbc53071de4eece06188d1ab408e162df5d54cd2ae283215beee99d8ec82699","observation_id":"039a7715-92dc-4cc5-a0a0-f8afe6e3ec75","resolution":{"observed_at":"2026-08-03T08:13:44.995598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.167837Z","title":"Carafe: Content-aware reassembly of fea- tures","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.167837Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:628730aac22ebba8c7e2f37ba6605b0429d526cb2eaf8113268499058c12ea38","observation_id":"efb74176-2e79-4c0f-a3ed-4d2647769af9","resolution":{"observed_at":"2026-08-03T08:13:45.167837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.248026Z","title":"Image quality assessment: from error visibility to 10 structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.248026Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:1a7e62f61eaddab274cfc589fe4622087778fbb062152b1fe3f884b86c5a1046","observation_id":"ae9fca4e-eaf5-4e6d-9d1c-a610e7c722f1","resolution":{"observed_at":"2026-08-03T08:13:45.248026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.331077Z","title":"Anyup: Universal feature upsampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.331077Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:435acccf33a934fcb7d18b9d3e1c958319d3642aa98736e593592f00579269ad","observation_id":"1651e6bb-a2ee-4dec-aa6b-6975aa7a5b88","resolution":{"observed_at":"2026-08-03T08:13:45.331077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.385037Z","title":"Rectifiedhr: Enable efficient high-resolution image generation via energy rectification.arXiv e-prints, pages arXiv–2503, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.385037Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:4b1f3c87d8530989f09f56e8bec3a17cf3873da556eb8203a1e02c6aefc20f58","observation_id":"ead6bcca-2b93-4f9f-baf2-4955ec74fbbb","resolution":{"observed_at":"2026-08-03T08:13:45.385037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.469926Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.469926Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:770ce9c129fa2c3abbd9cd41860e8ec5691e28b21e7f9a147f77a96c5fe5b079","observation_id":"e360f206-834c-4e2f-8aa8-b0769b6e98af","resolution":{"observed_at":"2026-08-03T08:13:45.469926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.542546Z","title":"Semantic under- standing of scenes through the ade20k dataset.International Journal of Computer Vision, 127(3):302–321, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.542546Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:a14cc360a17c4af49610324c5efd6079667e59411f9091804073de1ea38db10f","observation_id":"641e34b9-709c-4dd2-97d9-b9196cbf27ad","resolution":{"observed_at":"2026-08-03T08:13:45.542546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02283","last_updated":"2025-02-08T02:30:27Z","snapshot_observed_at":"2026-07-31T14:59:23.896620Z","submitted_at":"2024-07-02T14:12:21Z","title":"A Refreshed Similarity-based Upsampler for Direct High-Ratio Feature Upsampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02283","snapshot_observed_at":"2026-08-03T08:13:45.640312Z","title":"LiFT” runs the model four times for16×upsampling and “LiFT-2×","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.640312Z"},"links":{"cited_paper":"/paper/2407.02283","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:1ed6193d2d9c39bed912b196cb1dbe239fc028eda96d5cab37404cdccddd0d48","observation_id":"cfddd52d-7aed-4f11-8d38-f03e5e29158d","resolution":{"observed_at":"2026-08-03T08:13:45.640312Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:13:45.726694Z","title":"Best viewed zoomed in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:45.726694Z"},"links":{"citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:cdab78c2eba0dd79cfd13229e7c9260e57d01bb8967e8df3e7a1232e371d86bd","observation_id":"6695577e-023e-43bc-b13d-89133eef64fb","resolution":{"observed_at":"2026-08-03T08:13:45.726694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:02:25.142751Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2601.17950."}