{"as_of":"2026-08-16T18:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06c9eb2e9514dcd17fe68d1b91ee3fc3adcc8ff2c4f130b5eb5119ba714754e0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:34:51.075189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T19:36:29.309759Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:3543e5b8e4864d822114aff7ca497f0beab66e56a63ee4a39b8c6322ae04ea58","observation_id":"95d6b0c8-dd8e-4220-8118-9c4fa2e4ccbb","resolution":{"observed_at":"2026-05-16T04:09:36.295493Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-12T18:02:15.166483Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12044","last_updated":"2025-04-14T16:02:15Z","snapshot_observed_at":"2026-08-16T15:01:25.833290Z","submitted_at":"2024-11-18T20:31:38Z","title":"ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:02:15.166483Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2411.12044"},"observation_digest":"sha256:fbbc34c5ef55f59de447049cad1b61bc009b4d51cd37296456e1e957f2749edc","observation_id":"d9606a73-0f19-4eea-9f67-e31315b3625e","resolution":{"observed_at":"2026-08-12T18:02:15.166483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-11T22:19:06.859418Z","title":"Sclip: Re- thinking self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03561","last_updated":"2024-12-04T18:56:04Z","snapshot_observed_at":"2026-08-15T07:02:35.320754Z","submitted_at":"2024-12-04T18:56:04Z","title":"FLAIR: VLM with Fine-grained Language-informed Image Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:06.859418Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2412.03561"},"observation_digest":"sha256:5a4391876b65993424f455504cd128560bb016d47212308126e9d842d9d9484e","observation_id":"e83e9750-a805-4292-b29e-2252dc0bbc73","resolution":{"observed_at":"2026-08-11T22:19:06.859418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2501.12632","last_updated":"2026-04-29T19:18:41Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T04:36:17Z","title":"TeD-Loc: Text Distillation for Weakly Supervised Object Localization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T05:11:17.213575Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2501.12632"},"observation_digest":"sha256:2a8e9b8b6713603e5667953de0c7f3d312442373da22c22d98ecb513dcde08b3","observation_id":"fa374632-36a5-41e3-ac66-f08ac7cf0f30","resolution":{"observed_at":"2026-05-23T05:12:34.882674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-10T13:35:59.711061Z","title":"Sclip: Rethinking self-attention for dense vision-language inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16410","last_updated":"2025-01-27T18:57:19Z","snapshot_observed_at":"2026-08-13T09:53:35.291624Z","submitted_at":"2025-01-27T18:57:19Z","title":"DynAlign: Unsupervised Dynamic Taxonomy Alignment for Cross-Domain Segmentation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T13:35:59.711061Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2501.16410"},"observation_digest":"sha256:c83abd81824c719979571779e2ac6a50bf8feca664852fb251f87785f4803948","observation_id":"45b0c1f1-b919-43be-83aa-6433dd16fcd7","resolution":{"observed_at":"2026-08-10T13:35:59.711061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-09T21:29:34.973117Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19084","last_updated":"2025-01-31T12:19:14Z","snapshot_observed_at":"2026-08-14T13:55:56.766454Z","submitted_at":"2025-01-31T12:19:14Z","title":"Laser: Efficient Language-Guided Segmentation in Neural Radiance Fields","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T21:29:34.973117Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2501.19084"},"observation_digest":"sha256:0f9310a09585ec687c9078ca835a950bdc9076ade5a02404e1cfb0eff6fa65ce","observation_id":"0ae76e9d-c700-4f74-812a-449e6060ed27","resolution":{"observed_at":"2026-08-09T21:29:34.973117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-15T23:34:51.075189Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.075189Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:13265b7350b7f123ef281801187dd7c06c922658a364581013adcd855f07035a","observation_id":"ccdf75bc-5191-4cec-915c-76003b377e57","resolution":{"observed_at":"2026-08-15T23:34:51.075189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-07T14:39:37.747635Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference.arXiv preprint arXiv:2312.01597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18022","last_updated":"2025-06-02T10:46:01Z","snapshot_observed_at":"2026-08-09T10:21:45.430356Z","submitted_at":"2025-05-23T15:27:57Z","title":"RemoteSAM: Towards Segment Anything for Earth Observation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:37.747635Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2505.18022"},"observation_digest":"sha256:28b9335462b9bcca2c687db0d84d9ef59fdeb76055eee7c61cddc7cdfd763777","observation_id":"dea6da46-5bb6-46f9-afb3-3b67f67e0f14","resolution":{"observed_at":"2026-08-07T14:39:37.747635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-07T11:46:58.263286Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01539","last_updated":"2025-06-02T11:05:28Z","snapshot_observed_at":"2026-08-08T06:00:29.569012Z","submitted_at":"2025-06-02T11:05:28Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.263286Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2506.01539"},"observation_digest":"sha256:8285ca3eed43d59688eda09390170e362a15813fb0b5a29c49748b55dab6c278","observation_id":"09dbf5f1-110e-488e-9ac2-1ae488ea66a6","resolution":{"observed_at":"2026-08-07T11:46:58.263286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-05T16:41:41.714250Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18067","last_updated":"2025-08-25T14:22:57Z","snapshot_observed_at":"2026-08-10T13:26:33.891146Z","submitted_at":"2025-08-25T14:22:57Z","title":"Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:41.714250Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2508.18067"},"observation_digest":"sha256:882955616914c93cd50b5db912e7e8a36f603637896d384be012cad5717b2e7d","observation_id":"32c87e97-1ff2-4d3e-9086-afb29d14dacf","resolution":{"observed_at":"2026-08-05T16:41:41.714250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-05T15:18:45.993153Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-16T06:35:29.825832Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.993153Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:acf4f38409d374966c57600acd348e98f0de931709338028b77384bc47f353e2","observation_id":"e2bf5ff8-3e61-47e1-87bc-2b01717e3ca2","resolution":{"observed_at":"2026-08-05T15:18:45.993153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2512.08730","last_updated":"2026-04-22T15:53:23Z","snapshot_observed_at":"2026-08-13T10:09:48.723929Z","submitted_at":"2025-12-09T15:42:28Z","title":"SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T23:53:27.350335Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2512.08730"},"observation_digest":"sha256:10ac45992b1be480870f256b882be8da05094a2245a0bd3ffef8880779d5b6af","observation_id":"5ada7ad0-ce1b-44ae-a086-e5c6120bff8c","resolution":{"observed_at":"2026-05-16T23:53:42.275004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2605.18193","last_updated":"2026-05-18T10:32:48Z","snapshot_observed_at":"2026-08-15T13:10:13.636806Z","submitted_at":"2026-05-18T10:32:48Z","title":"Best Segmentation Buddies for Image-Shape Correspondence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T11:10:29.360224Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2605.18193"},"observation_digest":"sha256:524310961b1d9bd67a48a5404e97165a2b933dfbf193c6a3e63ca85cc19da992","observation_id":"904df424-5af3-42ff-a8ee-23f9b138e10f","resolution":{"observed_at":"2026-05-20T11:13:13.524486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-08-15T02:04:16.167034Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:d28726a939fdd30065bce52d424f649d320f49a8f57e5256bf3fe84be1928f57","observation_id":"d3127534-8c85-4768-9f13-e70fa482d691","resolution":{"observed_at":"2026-05-20T05:53:04.512876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:b845054e67608f4dd092c051c4bca329cd247b12d969a9b48bcc6ce299915279","observation_id":"efff4043-dec5-4d7f-8b6c-0bd95051a59a","resolution":{"observed_at":"2026-07-04T00:09:15.262035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":241,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:e0919253a0f7b7e1ba4ab7b3bfa68060ba0719512f8e7646f2004c0b65e6dcf4","observation_id":"1a10c2ce-6aeb-45f7-b0a5-da57f1b67a4b","resolution":{"observed_at":"2026-07-04T06:39:37.544202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":"2312.01597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-09T19:36:29.309759Z","title":"Sclip: Rethinking self- attention for dense vision-language inference","venue":"cs.CV","work_id":"aefe824e-4972-4d96-ac62-e361ee035a62","year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T19:26:49.805499Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:f70714c4bbe928d5e937d9dcc61f63ad8cebf790f2eb5ea83b7e2ddd52ac8211","observation_id":"f47636fc-376e-4604-be5c-99e36a71e536","resolution":{"observed_at":"2026-07-09T19:36:29.311029Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"arXiv preprint arXiv:2312.01597 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:a2e8e48bbfd9439bd9953644d13502ea60ff52f5d7fe60406dec44254bd206de","observation_id":"ecf2435e-9775-47b6-8ef4-e92d53dad321","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-08T04:20:20.323156Z","title":"arXiv preprint arXiv:2312.01597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03023","last_updated":"2026-08-04T02:12:39Z","snapshot_observed_at":"2026-08-15T15:33:02.793349Z","submitted_at":"2026-08-04T02:12:39Z","title":"Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T04:20:20.323156Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2608.03023"},"observation_digest":"sha256:0cc0dce97178044a572fa13b9f8a2b0f92d98899901009cad01815ddf99f2b1c","observation_id":"28551c3f-0a01-4fbb-9289-d09829405572","resolution":{"observed_at":"2026-08-08T04:20:20.323156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.01597/citation-record","integrity":"/paper/2312.01597/integrity","json":"/paper/2312.01597/citation-record.json","paper":"/paper/2312.01597"},"outbound":[],"paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2312.01597."}