{"as_of":"2026-08-14T00:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58c53d6e198f66bd44f1f749b7da9cc0145f29408b8d967201d9039f8d7ad038","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:08:51.045860Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15620/citation-record","integrity":"/paper/2411.15620/integrity","json":"/paper/2411.15620/citation-record.json","paper":"/paper/2411.15620"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.709836Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"e89909f0-39fb-4ef7-a6ad-250b0041d2e7","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.799557Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:2fdec1db0e16e25c91f5419bafee7593812ef6d6af4a1ae149a849eb29ecca6b","observation_id":"50138ab6-374a-454f-bca6-0960389ac1e5","resolution":{"observed_at":"2026-08-12T14:08:52.782620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:50.808537Z","title":"Everingham, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.808537Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:5c64d42349b48dec936da04b837c1122987b6dd9246db91038a5ff07a96fe382","observation_id":"3ad24b57-c0b5-4f24-a988-9c873b24aef4","resolution":{"observed_at":"2026-08-12T14:08:50.808537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.570683Z","title":"Salience detr: Enhancing detection trans- former with hierarchical salience filtering refinement","venue":null,"work_id":"18300310-fa83-4eb2-b306-4aa9eabd3f2d","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.816298Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:9f4a9c5f70e716e531c4c4dc965bead9f2e48c596c64042cd530b5d04ac56721","observation_id":"fa83f4eb-2b2a-4bde-9434-f4c78f9a6aed","resolution":{"observed_at":"2026-08-12T14:08:52.619603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.531910Z","title":"Relation detr: Exploring explicit position relation prior for object detection","venue":null,"work_id":"648aaed5-c69b-49b8-8f64-89c6df08e6fe","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.826991Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:80ac2844ac02b9f0425abcf5712ed490586b7db58123e7b1ddb6fe3502a35f6a","observation_id":"210ce89d-a7c3-4dc2-9d01-d0851234644f","resolution":{"observed_at":"2026-08-12T14:08:52.547675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.455547Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"71cdb5ec-f936-40b6-9af0-f67fdd4038b0","year":2021},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.832716Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:2f318a7bc7b7c760503e91f847e4ec2b10cbcea9d015f00dde2fb88406fb8289","observation_id":"79c4197b-d459-4276-963d-830d183012e8","resolution":{"observed_at":"2026-08-12T14:08:52.495515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.314151Z","title":"Rea- soning grasping via multimodal large language model","venue":null,"work_id":"62fdc670-edc3-4935-80eb-6a6ac734ecde","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.840529Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:1a5befaf23fe018df0371031ba2e84ffb86a32cc645a5888baf8101013541780","observation_id":"337d7243-e6e6-4a86-a567-435a4b096caa","resolution":{"observed_at":"2026-08-12T14:08:52.387944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-12T14:08:50.850774Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.850774Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:5621e6b90407ac255b6d3a3d6ed887e3834dfe666e3d9ac7a9a16afad33fa8f8","observation_id":"35747dbc-4335-47ce-81f3-21932321792e","resolution":{"observed_at":"2026-08-12T14:08:50.850774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.219077Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"c434fb67-ac82-4b5c-91ea-7413ef7bf071","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.861734Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:087af10afa5c1bd340f7d5f5d41b82dac65e8f2845b0bc4418582eb613d6217d","observation_id":"6219f2b7-5734-4e37-b39b-e90fc803bdd4","resolution":{"observed_at":"2026-08-12T14:08:52.231673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.181882Z","title":"Grounded language-image pre-training","venue":null,"work_id":"c61b68c5-ed9c-40ad-8cbf-e13c293475b3","year":2022},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.873299Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:52cbba1af0338389f4514eed227e04f7bc3699b905d2ca8d4aa46e717503d6f2","observation_id":"fb9f3cba-f79d-4b78-807a-58ce65695933","resolution":{"observed_at":"2026-08-12T14:08:52.193813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-12T14:08:50.882876Z","title":"Belongie, Lubomir D","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.882876Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:c2645c8d07aaff58ca78c9e9d90d70f3d7dee0d546f01e9d07424f90623b7c1a","observation_id":"c30fb905-77d4-4b98-b6a0-18c71d00e3c2","resolution":{"observed_at":"2026-08-12T14:08:50.882876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:52.093845Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"bcc3dd08-f978-4b52-9333-6aa4520639af","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.892988Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:1b4d85ee07991cd4b2759bb6c5ac08861573e190db4592a079ddddfb34ac4b24","observation_id":"ec1aa3e9-5be7-43c4-88dd-05116502b2bd","resolution":{"observed_at":"2026-08-12T14:08:52.153977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.978509Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"f3d85658-437f-40a2-9fd6-8dd5a308e37e","year":2021},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.903311Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:dad102714f407612d17038f26b50fc9f3db31e2d50389721d08ddd64aedce9d2","observation_id":"be5e2057-faa5-49aa-a18c-ca5c110d3ac6","resolution":{"observed_at":"2026-08-12T14:08:52.021915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.894116Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"c5066271-7f18-4fac-9a8b-b7b00761d602","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.909609Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:dde724684603ca29af16981f1692ded77baf513500d4f3937dd1314ed9a470c8","observation_id":"7f1415ec-09b3-4030-b373-465973c58d77","resolution":{"observed_at":"2026-08-12T14:08:51.904431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:08:50.917523Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.917523Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:20398c371f614a536a83d6f4ff9fdfddf3d2e3b896853cd50ce2ae86510680c4","observation_id":"92d8ffe7-0b9f-4867-8d12-9ae52b9c1c4b","resolution":{"observed_at":"2026-08-12T14:08:50.917523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:50.925751Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.925751Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:d50bd7c6a67beb0969e62d62f9f947d601a33bc639991d3becb0b698dcb77fc9","observation_id":"ad72e87f-d283-4eb8-b513-eb863308019b","resolution":{"observed_at":"2026-08-12T14:08:50.925751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T14:08:50.933022Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.933022Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:7e7adf378b38da97251e6fae7db799b3262afcc854e071578b528899462e5040","observation_id":"8f65144c-6981-4181-b610-1fb1c1de4d63","resolution":{"observed_at":"2026-08-12T14:08:50.933022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-12T14:08:50.940066Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.940066Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:33637c8bc1a20aae879c2cf0e0751a959bf3e79d6e7822e9d71652758bb90e61","observation_id":"3b04b5d5-8898-4ba3-99ab-4ee6f4312242","resolution":{"observed_at":"2026-08-12T14:08:50.940066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.845335Z","title":"Yolov3: An incremental improvement","venue":null,"work_id":"7745571c-e6ae-4a25-8b96-b4eb80a1dfe0","year":2018},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.947093Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:e7257b9f06db6257dfdcd0cb2e9ab2f085591be0068277638d1ab6c28b8abedf","observation_id":"b0b50802-1b23-45ee-bac7-b2f08ca6c85a","resolution":{"observed_at":"2026-08-12T14:08:51.855646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.781368Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"b1158f87-86d8-40f1-b731-393bda271a21","year":2015},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.955086Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:da44df4ea3ffc1dc52b0ab60f03cc68962f9059eba81e437e4170c8bc91d515d","observation_id":"1bacba83-b9aa-4812-ad7f-277872890c04","resolution":{"observed_at":"2026-08-12T14:08:51.817071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:50.961143Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.961143Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:744341a3d25fa972a42ed83396eff01e1f7ae3881f12e4ab4cd5679ca30fae0c","observation_id":"41ba8b2b-e49b-48e4-a1d4-31daaef17d8e","resolution":{"observed_at":"2026-08-12T14:08:50.961143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.612650Z","title":"Grounding language models for visual entity recognition","venue":null,"work_id":"3017f34d-bcac-4f20-a8ba-bbd18c4832f6","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.972021Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:fed58332fbfb76cd7415c6fbcc994c7a2212e8384b4e7fa1a9f413edb16d4129","observation_id":"d51c7704-469e-420d-81d3-8d856f51345a","resolution":{"observed_at":"2026-08-12T14:08:51.660960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.536094Z","title":"Visa: Reasoning video object segmentation via large language models","venue":null,"work_id":"09c163cd-e5dd-4da6-8748-237412821019","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:50.987492Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:8be1905f00076930b7592c06b7adb257a15d8505e23de82c56cce57d5013f61d","observation_id":"1bd54eb3-1b2f-4d2e-ac0a-c57aea135967","resolution":{"observed_at":"2026-08-12T14:08:51.547226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.482611Z","title":"Detclipv3: Towards versatile generative open-vocabulary object detec- tion","venue":null,"work_id":"7a1c01d0-0774-4c5a-8ed1-01bbd22d507e","year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:51.001752Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:6c73a82121527f7d9aee5790c2459f94dccc79cc34b4e496f29aef827ec46096","observation_id":"acc33548-8d83-4de0-98c3-27d49d270014","resolution":{"observed_at":"2026-08-12T14:08:51.499368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.016112Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:51.016112Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:885cf803b87ae71a9d61234978bcfa21ccb6f78519140428858adcde3c7a9c55","observation_id":"ea0853c3-9ac0-4c9b-a826-d060fdf95993","resolution":{"observed_at":"2026-08-12T14:08:51.016112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.405377Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":"72b1f13c-40ab-4151-a4e2-6b172071f4ed","year":2023},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:51.024807Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:eaf84212e490b6b8ff382f26b0191973c7ec1275912a780916d33303cd09b9e4","observation_id":"c7a90017-2aa7-4879-b148-a75a3c757406","resolution":{"observed_at":"2026-08-12T14:08:51.422003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-13T11:23:36.861921Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-12T14:08:51.038158Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:51.038158Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:b15a8bf76705528b9755b5f6aa7c7669a66065036cffd91ae004b9d687016f94","observation_id":"7e5658a2-92f1-4125-939a-109bbe38a5c6","resolution":{"observed_at":"2026-08-12T14:08:51.038158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:51.365271Z","title":"Detrs with col- laborative hybrid assignments training","venue":null,"work_id":"cde991ea-eb9d-43e0-9dd0-d70bb40f0a5f","year":2023},"citing_paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:51.045860Z"},"links":{"citing_paper":"/paper/2411.15620"},"observation_digest":"sha256:507b92dbc3e46bf8db93e53a77a6b6afb570f0001812ca9360155ca9068c3b36","observation_id":"16020361-37af-4ae2-bde3-c36d1b42f02e","resolution":{"observed_at":"2026-08-12T14:08:51.373602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15620","last_updated":"2024-11-23T18:13:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:03:56.275310Z","submitted_at":"2024-11-23T18:13:27Z","title":"Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2411.15620."}