{"as_of":"2026-08-12T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16bbd711984b563a1cedfe3560c32fc9b228c1afeb527ae235899c1d487a630b","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:28:54.692620Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14145/citation-record","integrity":"/paper/2412.14145/integrity","json":"/paper/2412.14145/citation-record.json","paper":"/paper/2412.14145"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.170023Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":"31c357fc-9fb7-49a8-b522-6f43669d6c48","year":2021},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.531565Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:6785531a36a49cd8d2df89628bf723a92904e839fcdaa2bd59afa5af7be8e349","observation_id":"b5427c4b-9860-4c57-bace-aff9c1397599","resolution":{"observed_at":"2026-08-11T12:28:55.173886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.159695Z","title":"Scaling open- vocabulary image segmentation with image-level labels,","venue":null,"work_id":"57262cc2-6b84-4880-806b-b00322d4fa93","year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.536071Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:eb8bee1b2d7441e0ffc218352eb35e45c4cd859e2014ea79f6f8f7bc1a0bf7cb","observation_id":"50b60ac0-0715-4811-b6fd-3f5bee94b0bd","resolution":{"observed_at":"2026-08-11T12:28:55.163182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.149737Z","title":"Maskclip: Masked self-distillation advances contrastive language- image pretraining,","venue":null,"work_id":"fc5459ce-069c-4f7d-b316-34bb94f8ceff","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.539928Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:897f88c348e1003cda58ccb898e7fdc6317f7dad2b969f66c35d2ff2f3aed558","observation_id":"cc893f0c-a7f4-4c98-823d-1eb76eee6c6f","resolution":{"observed_at":"2026-08-11T12:28:55.153290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.139370Z","title":"A simple framework for text-supervised semantic seg- mentation,","venue":null,"work_id":"8f4e8aba-1713-446b-afef-e7dfd481341e","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.543564Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:d93468d3caba64596bac82c9bb36b508048dc9eaf6fc8f0dc76576da5473dbb4","observation_id":"972b8691-b4cd-449e-883a-67f6f17c0bbf","resolution":{"observed_at":"2026-08-11T12:28:55.143201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.129266Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":"f7c7f962-c2e9-4e17-9bb9-6ced0fd2e670","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.547221Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:27943dea56d3a871bafe46929bd78ebe6dec602d508c2abd9247a525e7cfe5af","observation_id":"9c82c757-c7b6-4429-8528-db57f157d503","resolution":{"observed_at":"2026-08-11T12:28:55.132843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.551301Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.551301Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:94199a094ef835879c1ecf11e7bd3bc64264333ee49ab1a66a73ac8cde19fad8","observation_id":"992b89fe-45a8-4713-aedf-80ea4459adf4","resolution":{"observed_at":"2026-08-11T12:28:54.551301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02955","last_updated":"2024-09-14T00:26:00Z","snapshot_observed_at":"2026-08-11T08:44:26.816766Z","submitted_at":"2024-01-05T18:59:22Z","title":"Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02955","snapshot_observed_at":"2026-08-11T12:28:54.555338Z","title":"Open-vocabulary sam: Segment and recognize twenty-thousand classes interactively,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.555338Z"},"links":{"cited_paper":"/paper/2401.02955","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:69a245cf03b36659826e289d459d80a37b9e2b43c257dd0caa986e173a1f4d70","observation_id":"8ca79fc6-8334-484c-98f6-9a6c41bd07be","resolution":{"observed_at":"2026-08-11T12:28:54.555338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09620","last_updated":"2024-03-14T17:55:03Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:55:03Z","title":"PosSAM: Panoptic Open-vocabulary Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09620","snapshot_observed_at":"2026-08-11T12:28:54.559154Z","title":"Possam: Panoptic open- vocabulary segment anything,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.559154Z"},"links":{"cited_paper":"/paper/2403.09620","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:275c9165ec10df9bcdccca97da5dffbb07f141c6d704d70bad44923f785e9d7f","observation_id":"ffd22855-5026-4349-b6c4-3fceed9484d2","resolution":{"observed_at":"2026-08-11T12:28:54.559154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-10T21:35:35.307242Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-11T12:28:54.562982Z","title":"Diffusion models for zero-shot open-vocabulary segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.562982Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:a3faf7b54c7d56924bff6a08cbac84532cc8a60c2ba54756f10bd96b56db4e88","observation_id":"df7f4408-53c8-47de-9c8c-8327f1c0a018","resolution":{"observed_at":"2026-08-11T12:28:54.562982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.112581Z","title":"Open-vocabulary panoptic segmentation with text-to- image diffusion models,","venue":null,"work_id":"38fd27da-f716-4e32-be82-7e25a6769504","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.566808Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:181fba92ec32fe6fee126f9d77030487d84822d10875f250b2d7cd39fc19e357","observation_id":"e605d83f-9f1a-4fbd-ba21-b35340394eb6","resolution":{"observed_at":"2026-08-11T12:28:55.116402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11797","last_updated":"2024-03-31T11:53:55Z","snapshot_observed_at":"2026-08-10T15:40:12.549701Z","submitted_at":"2023-03-21T12:28:21Z","title":"CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11797","snapshot_observed_at":"2026-08-11T12:28:54.570344Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.570344Z"},"links":{"cited_paper":"/paper/2303.11797","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:f21cb6d1ee8bfcab50936955f872085243a8fe93117260018aa927cdefada92d","observation_id":"d6b4f834-4c8d-40e6-ad00-57a957021889","resolution":{"observed_at":"2026-08-11T12:28:54.570344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-11T12:28:54.573992Z","title":"Clipself: Vision transformer dis- tills itself for open-vocabulary dense prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.573992Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:32a15587fd4a0f81d44c918b80445cddc53e092ab1c6fd53522f338ed4bc025b","observation_id":"1cdb15f9-1aa4-489c-aa98-652d46c7807e","resolution":{"observed_at":"2026-08-11T12:28:54.573992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12359","last_updated":"2024-03-27T10:18:04Z","snapshot_observed_at":"2026-08-10T01:21:49.854534Z","submitted_at":"2023-12-19T17:40:27Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12359","snapshot_observed_at":"2026-08-11T12:28:54.577649Z","title":"Clip-dinoiser: Teaching clip a few dino tricks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.577649Z"},"links":{"cited_paper":"/paper/2312.12359","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:045dacc18b8f60886eb7e3cc81d4c31b7fc840f0c197ff534ae660e75574e6fe","observation_id":"bcacc359-537f-40ee-ba76-661dedc8a5a1","resolution":{"observed_at":"2026-08-11T12:28:54.577649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-09T10:52:28.294442Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T12:28:54.581153Z","title":"What do vision transformers learn? a visual exploration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.581153Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:5992d527b76288e00bc525b7aca304830040b85ef86dde5cb07076a7c5dc984b","observation_id":"4e5bdf5b-22c8-4752-8bf7-ef7ad3bce46a","resolution":{"observed_at":"2026-08-11T12:28:54.581153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-11T12:28:54.584693Z","title":"Deep inside convolutional networks: Visualising image classification models and saliency maps,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.584693Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:70fc206588034fa4339edaa9ff98ee14ffb74a7572c1fd79fb1874cb03a9f3ab","observation_id":"c4766506-8db1-4ba6-a40d-041431829357","resolution":{"observed_at":"2026-08-11T12:28:54.584693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.102382Z","title":"Visualizing and understanding con- volutional networks,","venue":null,"work_id":"6364e543-df92-4f37-943d-720ac33fa761","year":2014},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.588193Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:0a4d2b24d3ec0fa000d5b1b17aa33a94986502d7ffa0ccb3f8d42f6d6b28fe86","observation_id":"3503b708-5e4a-4eda-981d-76a2732ff5c8","resolution":{"observed_at":"2026-08-11T12:28:55.105885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.092018Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":"a230be06-0dd3-4a0e-89c6-439a7688f7a6","year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.591700Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:b1e97aa78676deeb570be45cbcda9f22f6e61fc44a0124d157080a4a2be4a6ad","observation_id":"83ea2eb9-3c3a-410d-8d99-db8510550720","resolution":{"observed_at":"2026-08-11T12:28:55.095809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04044","last_updated":"2023-07-10T20:59:46Z","snapshot_observed_at":"2026-07-06T13:29:20.200379Z","submitted_at":"2022-07-08T17:59:01Z","title":"kMaX-DeepLab: k-means Mask Transformer","version":5},"cited_work":{"arxiv_id":"2207.04044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04044","snapshot_observed_at":"2026-08-11T12:28:54.831508Z","title":"kMaX-DeepLab: k-means Mask Transformer","venue":"cs.CV","work_id":"2d07ef80-85f8-49e7-85b1-631c980ded4e","year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.594970Z"},"links":{"cited_paper":"/paper/2207.04044","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:8450bdee5caefc455efc02aa60f6f500ab4cf622d704903e9db8aec61862b0f6","observation_id":"1c0601f6-8278-40c1-8726-6806869e7b6f","resolution":{"observed_at":"2026-08-11T12:28:54.835331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11679","last_updated":"2023-09-21T23:04:42Z","snapshot_observed_at":"2026-07-06T14:21:18.799177Z","submitted_at":"2022-11-21T17:47:48Z","title":"Mean Shift Mask Transformer for Unseen Object Instance Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11679","snapshot_observed_at":"2026-08-11T12:28:54.598543Z","title":"Mean shift mask transformer for unseen object instance segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.598543Z"},"links":{"cited_paper":"/paper/2211.11679","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:335bdb6c4e94cd0438d575ea096b130412d997e71c5c90c303d9748ab63e04b2","observation_id":"d4249441-34d9-4b6a-841e-fc8b08bb3275","resolution":{"observed_at":"2026-08-11T12:28:54.598543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.081643Z","title":"Feature pyramid networks for object detection,","venue":null,"work_id":"03732609-e6ed-47f0-b379-f5ee1b832915","year":2017},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.602047Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:17cf331910c34acadfec10c629ab3fb446a578b9df78ded8c8e8f62087b9ea16","observation_id":"049da7c3-a12f-492d-b79e-62c805178002","resolution":{"observed_at":"2026-08-11T12:28:55.085224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.605146Z","title":"U-net: Con- volutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.605146Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:4ddaa2a247ef2b5534b8dbaa724ea11d46b69d2f33bbf7488181d51487bab54e","observation_id":"ff4509e9-a618-4a62-8248-819842c682a9","resolution":{"observed_at":"2026-08-11T12:28:54.605146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.065473Z","title":"Side adapter network for open-vocabulary semantic segmentation,","venue":null,"work_id":"78cd8f60-5f15-4da5-8dc6-117979aa8650","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.608476Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:4a60e0dfe8e4840ecfd16362ee627c72a3f4c13030895e656db15fc8624fe7a2","observation_id":"6466be89-36ee-4f16-ac21-cd62f1279f0f","resolution":{"observed_at":"2026-08-11T12:28:55.069221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.055381Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip,","venue":null,"work_id":"04d31582-4ceb-429d-8999-91f869b35dc3","year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.611725Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:acb41d3eff2d45a247157538aabffc09b2e8658d49610d78e17495f760918533","observation_id":"b9136e1f-4ba0-40c0-984a-6e0758938a33","resolution":{"observed_at":"2026-08-11T12:28:55.058960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15537","last_updated":"2024-02-27T10:59:30Z","snapshot_observed_at":"2026-07-06T16:52:53.954856Z","submitted_at":"2023-11-27T05:00:38Z","title":"SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15537","snapshot_observed_at":"2026-08-11T12:28:54.615005Z","title":"Sed: A simple encoder-decoder for open-vocabulary semantic segmen- tation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.615005Z"},"links":{"cited_paper":"/paper/2311.15537","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:559687d31106f87e05353d8025d3951f3a3d7968da10c9c43db4c25849b58fdd","observation_id":"d68e1c9f-488b-4ccc-aacd-814675b4002c","resolution":{"observed_at":"2026-08-11T12:28:54.615005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.045170Z","title":"Neural discrete representa- tion learning,","venue":null,"work_id":"2dc6139c-88ff-4b55-83a8-a9bf44d2c9e4","year":2017},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.618322Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:7da396a2cdbb118f445346c043877665210004f1ff3a34aff8480179a254f4b2","observation_id":"4ef04c76-04ba-46fb-9400-41d6bd4e275d","resolution":{"observed_at":"2026-08-11T12:28:55.048805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.034592Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":"a2bafe1c-8a4f-49b9-b6e7-3fec36097603","year":2021},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.621378Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:a5e9d4c5a268abb26da5fdfa8366e5e52fde8516927b8cd0056a45cab22b41f4","observation_id":"2cb0daf9-a28b-45c9-85b6-7763eb10a64d","resolution":{"observed_at":"2026-08-11T12:28:55.038366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-11T12:28:54.625040Z","title":"Vector-quantized image modeling with improved vqgan,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.625040Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:46e840a62a6486adc616ced28a8535d287e3313e598635027e14f493b35f633b","observation_id":"f4a46ed8-aeab-453d-ab11-88ecb5bb7917","resolution":{"observed_at":"2026-08-11T12:28:54.625040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.628528Z","title":"High-resolution image synthesis with latent diffu- sion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.628528Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:f4a3762c8f38dbde9f42fb453780d07dd446cca054cabdef1f09cdb8228c84c2","observation_id":"f47ff8d7-6508-41c2-9ea0-dd5cdb03df43","resolution":{"observed_at":"2026-08-11T12:28:54.628528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-11T00:20:29.155513Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-11T12:28:54.631621Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.631621Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:a158ebd40b70b1abd58f8292cff24341088e7c2b11fe56306c01c51f0c225403","observation_id":"fbd8280d-ead5-4518-a2ee-fc4bb9d8c747","resolution":{"observed_at":"2026-08-11T12:28:54.631621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.018004Z","title":"Coco-stuff: Thing and stuff classes in context,","venue":null,"work_id":"2eca4572-7a00-4284-ad35-6ca5ddbd8e0e","year":2018},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.635233Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:a4e214010ddf40b836309a739d85e1837cf8e5ab5e0f2f4f50107f0cab6d1959","observation_id":"85aff2cb-5774-4beb-bb3d-de5bc04b0be0","resolution":{"observed_at":"2026-08-11T12:28:55.021844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:55.007573Z","title":"The role of context for object detection and semantic segmentation in the wild,","venue":null,"work_id":"da15e928-c0e8-40b0-8b0f-c1426aaede74","year":2014},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.638523Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:358a308e983ffb1b63bea3c4751cf891812c9f14443d245f6d1a3d942d7fca19","observation_id":"765bd182-0e1a-48e3-8356-c39d892e1915","resolution":{"observed_at":"2026-08-11T12:28:55.011252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.997274Z","title":"Scene parsing through ade20k dataset,","venue":null,"work_id":"308df2a0-850c-4f81-ae97-91f651c66f32","year":2017},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.641740Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:f0595626ff396eec3053d7acf9830c2c1154cc5c085badac0f59a311bdfa439a","observation_id":"506a3616-5c65-4581-8a3e-4db13a096757","resolution":{"observed_at":"2026-08-11T12:28:55.000841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12710","last_updated":"2022-12-07T19:11:20Z","snapshot_observed_at":"2026-08-01T13:05:37.465677Z","submitted_at":"2021-11-24T18:59:58Z","title":"PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12710","snapshot_observed_at":"2026-08-11T12:28:54.644923Z","title":"Peco: Perceptual codebook for bert pre-training of vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.644923Z"},"links":{"cited_paper":"/paper/2111.12710","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:8ae9120ccf039a1c1483b7a438e372eb21d9f5b3e12b6944cadda476462f514f","observation_id":"1827dfdb-0312-4da4-8d63-403c67c30525","resolution":{"observed_at":"2026-08-11T12:28:54.644923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.648555Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.648555Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:7c1c90ca7146a0c0e59e147acef8adbdf626b326b9b7bf6e127689fd7f8cefc6","observation_id":"3e5307f2-b09c-4d91-8dcf-9906fd5db058","resolution":{"observed_at":"2026-08-11T12:28:54.648555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.981002Z","title":"Spae: Semantic pyramid autoencoder for multi- modal generation with frozen llms,","venue":null,"work_id":"dd5e42b1-9528-41e1-a6cc-ec9810f7324c","year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.651853Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:4d396e5d5bcc83aa674c89db9a68782f0c0831b27e2a755e48739913714555e5","observation_id":"90ec1cc5-245c-47dc-8e4c-2ea08a419ff8","resolution":{"observed_at":"2026-08-11T12:28:54.984454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.970580Z","title":"A simple baseline for open-vocabulary semantic segmentation with pre-trained vision-language model,","venue":null,"work_id":"afc96134-af03-4553-82f0-7b414db3502d","year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.655155Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:f773afea68116c3fdef64fc2b206c944c2e35cec33b761ea90d53dfcd298ac75","observation_id":"c0cc1548-03b4-4e3c-b387-0305a1973e0d","resolution":{"observed_at":"2026-08-11T12:28:54.974485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02957","last_updated":"2024-07-22T09:07:27Z","snapshot_observed_at":"2026-08-10T19:06:52.473039Z","submitted_at":"2024-01-05T18:59:52Z","title":"Denoising Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02957","snapshot_observed_at":"2026-08-11T12:28:54.658445Z","title":"Denoising vision transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.658445Z"},"links":{"cited_paper":"/paper/2401.02957","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:c7fc226ca5b7de96066d313397ea81b5de5639bc9f9e16207b4ebb78d05c708e","observation_id":"0f38c679-ce8a-41a5-9dbd-e37c28aced91","resolution":{"observed_at":"2026-08-11T12:28:54.658445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10516","last_updated":"2024-04-01T20:57:45Z","snapshot_observed_at":"2026-07-06T17:45:23.748539Z","submitted_at":"2024-03-15T17:57:06Z","title":"FeatUp: A Model-Agnostic Framework for Features at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10516","snapshot_observed_at":"2026-08-11T12:28:54.661887Z","title":"Featup: A model-agnostic framework for features at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.661887Z"},"links":{"cited_paper":"/paper/2403.10516","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:20ad1c2dd17645ad3aae5c7c4cebe2cb669fd7d738285060d6726d5f2048a132","observation_id":"abf9a5df-293d-42dd-9316-3926d3dff4ce","resolution":{"observed_at":"2026-08-11T12:28:54.661887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.959650Z","title":"Learning to upsample by learning to sample,","venue":null,"work_id":"940e2516-9907-488a-bb26-3faf564355b2","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.665388Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:129cfb4856972f887ca2c3c17bede0b4e5e5c8c3833e0cbefd1c0e5b6970d417","observation_id":"9ab15bd0-f713-4ce1-9c03-f32bfa764ad1","resolution":{"observed_at":"2026-08-11T12:28:54.963282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13314","last_updated":"2024-01-08T13:30:56Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T09:39:19Z","title":"Unlocking Pre-trained Image Backbones for Semantic Image Synthesis","version":2},"cited_work":{"arxiv_id":"2312.13314","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13314","snapshot_observed_at":"2026-08-11T12:28:54.750402Z","title":"Unlocking Pre-trained Image Backbones for Semantic Image Synthesis","venue":"cs.CV","work_id":"23ac494f-68b4-44c4-8f28-d5cf8f8f509c","year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.668560Z"},"links":{"cited_paper":"/paper/2312.13314","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:7d80bb702cc073f3f0da95cf078717e1dc9d9ef4d2da2b38cea1cfa04a240af6","observation_id":"120bb874-1ed5-416f-bade-6f6ce7ada825","resolution":{"observed_at":"2026-08-11T12:28:54.755964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.949364Z","title":"Semantic image synthesis with spatially-adaptive normalization,","venue":null,"work_id":"f587187b-d3d6-4485-bbaa-d66bbf11dbc8","year":2019},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.671891Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:6d4a678f83d7ff39f1dc9441c911bd58855c6dd86557e8f901fc43202e420055","observation_id":"53127a81-6610-456e-9c5c-2734a18ba502","resolution":{"observed_at":"2026-08-11T12:28:54.952918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.938746Z","title":"Perceptual losses for real-time style transfer and super-resolution,","venue":null,"work_id":"3ca8299f-fd55-47ec-b027-7334ff777c63","year":2016},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.675122Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:96690db609093feef9494eb89cc89c3e65372fe569210b180941e0d529f94e5a","observation_id":"ec541cbe-96cf-4935-9d8e-1782438f64e6","resolution":{"observed_at":"2026-08-11T12:28:54.942402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T12:28:54.678661Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.678661Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:302c35f2ddbc4c87684d06d879f64f9171a89bec89197da48debb0dd2fad1082","observation_id":"b4c18bf1-7bb6-47f5-b9a3-7b845fbb448e","resolution":{"observed_at":"2026-08-11T12:28:54.678661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.927810Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"8ad87b6c-3fc2-4722-a1b6-0838e4175987","year":2014},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.682331Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:d8b063c17917ccbfa6bf3b2106551cfe0e5702c63e8a37eff7fa801bfc69ca64","observation_id":"f17d4c6b-b584-44cb-b1f1-cec17b07b2b9","resolution":{"observed_at":"2026-08-11T12:28:54.931400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T12:28:54.685689Z","title":"Eva- clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.685689Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:b8a07be7658e17202554ee2d150954f09db23cb1dd23b36d0e7571a6f1cb9c35","observation_id":"3cf76ff3-1008-4d6d-9bee-78d16881e09a","resolution":{"observed_at":"2026-08-11T12:28:54.685689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:28:54.917368Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":"4c80552d-f9e8-4e10-a4a9-b6a86fb93b80","year":2017},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.689247Z"},"links":{"citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:617b16d8b435bb2f372757a426b49b0877e1d13ebe885fe6ff2373f8b70784d5","observation_id":"ac6e7f16-ce8d-4df1-a5d8-7bb70ea2e82d","resolution":{"observed_at":"2026-08-11T12:28:54.920975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-11T12:28:54.692620Z","title":"Visual autoregressive modeling: Scalable image generation via next- scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.692620Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:1e0a460e053d13336bbebf09ef834cadc251ae2f7803688fbdeaae04af54efba","observation_id":"cb7be813-d7a4-40df-af8d-21964bf99eef","resolution":{"observed_at":"2026-08-11T12:28:54.692620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T12:23:56.755925Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2412.14145."}