{"as_of":"2026-08-15T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6f89e8262f798742b62839fe5e940301324e36e19c309e29665571b9874d13a","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:32:44.459932Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18806/citation-record","integrity":"/paper/2412.18806/integrity","json":"/paper/2412.18806/citation-record.json","paper":"/paper/2412.18806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.172563Z","title":"Label-embedding for image classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.172563Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f6633dd52fdf1825438751e3ebfed29e313e8f44f744a37df4d4355d4a4dd5ac","observation_id":"ec488dff-669b-41a2-bbff-64aa37573a2a","resolution":{"observed_at":"2026-08-11T04:32:44.172563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.176758Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.176758Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:2bb12addeeb160c3b486a6570921c18d6dcde73b37f99916af85d3c1e0c515b2","observation_id":"c125ee8e-1fac-4ae5-93ba-7684d01cdf5d","resolution":{"observed_at":"2026-08-11T04:32:44.176758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.184879Z","title":"Pseudo-labeling and confirmation bias in deep semi-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.184879Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:64de5df4682050fd271e5ae10c8546260b0d274a015a7d64c05384608273d6f8","observation_id":"9e82b47a-cec5-48bb-8e04-6d544622e4e8","resolution":{"observed_at":"2026-08-11T04:32:44.184879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.188636Z","title":"Bridg- ing the gap between object and image-level representations for open-vocabulary detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.188636Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a498a08204489d74c6e3ac6522aeb5ccd6228c6457a3cc4f0f271089f5636da6","observation_id":"d26f7b55-1ea4-47bd-b0f5-230404ba5725","resolution":{"observed_at":"2026-08-11T04:32:44.188636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.408102Z","title":"Zero-shot object detection","venue":null,"work_id":"5728c241-ee70-4b49-8447-e0a409da998e","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.192362Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:75630b77d2c4be04ca661befc03de3d56d57f4ed5d2769afb1929100ad3e8a1f","observation_id":"41970f72-8636-4b34-8d16-633b727c8d03","resolution":{"observed_at":"2026-08-11T04:32:45.411789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.196412Z","title":"Mixmatch: A holistic approach to semi-supervised learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.196412Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b55b355f190cc26d2689e6841fa8dd944e5379ae4f799ebb7129df63659de871","observation_id":"05dc9e84-02a1-4631-a38e-71b6cfa5fae3","resolution":{"observed_at":"2026-08-11T04:32:44.196412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.391177Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"11c1f31e-e464-4e90-b378-7972c232614c","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.200071Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:dcfad14c010eeaa2a01cc2375675f174669f2b234d5490461871372315f8fcb3","observation_id":"17a5de76-97ca-4339-98f7-13b0d9685fbc","resolution":{"observed_at":"2026-08-11T04:32:45.394749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.379931Z","title":"X-detr: A versatile architecture for instance-wise vision- language tasks","venue":null,"work_id":"dc145a04-a4d6-4d5e-aac6-ff2dbba02c00","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.203649Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:2d36d2642d3ab2cad0f91d19f485991628dcbafd35d4e91efe99f9d16a253915","observation_id":"4e90383b-b9f4-4eec-a88a-bb0a7e0f2dbe","resolution":{"observed_at":"2026-08-11T04:32:45.384161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.369973Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"d084276d-942f-475d-85f1-787e74842b1f","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.207011Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:898cf39d949c93f182c811279afcf27bb1d707a588db3f01110dacf51fe22b51","observation_id":"f87f0292-183b-4672-acc3-4919ee74a76a","resolution":{"observed_at":"2026-08-11T04:32:45.373408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.359538Z","title":"Big self-supervised mod- els are strong semi-supervised learners","venue":null,"work_id":"d8d55faf-a256-493f-8208-9148d2240925","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.210464Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f9746198cf4e9e53bf19f17bfeff5cac6d3372448753a26f5c411a664c92dd57","observation_id":"56821bf1-e47b-455d-95fc-595fd94361ff","resolution":{"observed_at":"2026-08-11T04:32:45.363471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.348106Z","title":"UNITER: universal image-text representation learning","venue":null,"work_id":"1ef3b5ef-86a0-4808-ad65-89f89c271fdf","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.214032Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:997a3908fbbc293d2be4d84b11c927938a06660860ee581c34de87be6e188d9e","observation_id":"0a833bd5-93f0-4192-95a1-42d607bf4af8","resolution":{"observed_at":"2026-08-11T04:32:45.352804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.337091Z","title":"Proba- bilistic embeddings for cross-modal retrieval","venue":null,"work_id":"714917c0-7b79-42b9-9ecb-c73374576ff9","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.217445Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:6abac7056d08e5561eba9dcf67336fe756145eb56d8f92209e51b61aa7d63ca8","observation_id":"61919452-1d70-4fe3-9c12-8542943725a4","resolution":{"observed_at":"2026-08-11T04:32:45.341194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.325844Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"17cc228f-8c82-407c-9fff-b42b9693728f","year":2009},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.220762Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b2584c00d9e6995033b4f84b9f4d37138f1113367d6f35c879f55bf3a5c4383c","observation_id":"903289dd-14d6-4b02-9e5f-95e5d290c92b","resolution":{"observed_at":"2026-08-11T04:32:45.330048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.313617Z","title":"Finding beans in burgers: Deep semantic- visual embedding with localization","venue":null,"work_id":"5a546476-6178-4add-a94e-3071310df286","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.224063Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:1f3aec47b6735df99465be9cd0eaa0ed5a1c77932986455981bdce6b37cc117b","observation_id":"6ce47396-f825-43a8-a6cf-66eae25fd29f","resolution":{"observed_at":"2026-08-11T04:32:45.318051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.302240Z","title":"Fleet, Jamie Ryan Kiros, and Sanja Fidler","venue":null,"work_id":"c0360840-1c2b-4232-b01f-e5aa5a6c4eb3","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.227298Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:73789e0cbece8b9cdccd0a1f75c088d4663fc03538586e839813a61a190bed1a","observation_id":"953e852d-7825-4d4a-95a3-827dbc5c7084","resolution":{"observed_at":"2026-08-11T04:32:45.306459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.290455Z","title":"De- vise: A deep visual-semantic embedding model.Advances in neural information processing systems (NeurIPS), 26, 2013","venue":null,"work_id":"57b128b7-85d3-4e10-800a-a574d18e0811","year":2013},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.230559Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:94029d3612abafb7f88f5ee6d599c74e7efddc2892877c6df9b9fb2204cffcb4","observation_id":"06144a13-524b-496b-b7e6-1f4c216a364c","resolution":{"observed_at":"2026-08-11T04:32:45.294893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.279367Z","title":"Understanding the diffi- culty of training deep feedforward neural networks","venue":null,"work_id":"08a28025-454e-4cee-97d4-854602f9ec5f","year":2010},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.233871Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a6f55d148db278b5615861b35fd35673ea223e681dbb6967dfabbfc373e82f61","observation_id":"3313c946-2ae3-4911-999a-8236d4c16ea0","resolution":{"observed_at":"2026-08-11T04:32:45.283263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.269511Z","title":"Improving image-sentence embeddings using large weakly annotated photo collections","venue":null,"work_id":"7a69ac74-ccef-4fbd-929a-5951be38934b","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.237175Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:6421b3af15f7e539aa911606a778e8c3be63327c9b3faa0e2f2e2ce42c2fa755","observation_id":"6863ac69-5e23-4c13-8d6e-3a8a42c5e877","resolution":{"observed_at":"2026-08-11T04:32:45.272919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.258492Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"f6a3bd77-a10d-4ae3-9466-69af7e94f72c","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.240663Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:6b4c452f350f51a8a671606019ef16782ae8f2a0dac2f6b9e540263f93d00546","observation_id":"719f7dc7-c08f-42a5-9630-e5623dc54cf3","resolution":{"observed_at":"2026-08-11T04:32:45.262866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.247402Z","title":"Girshick","venue":null,"work_id":"61740e71-e2f7-48f7-9acf-4caa0e9a35bc","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.243834Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:38440d2d7be13abb8e1f0145dea53da667a65835f3bf6a80804654824f69fc11","observation_id":"143294bd-f34c-424d-8c02-172b4b6160b1","resolution":{"observed_at":"2026-08-11T04:32:45.251143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.237026Z","title":"Generative multi-label zero-shot learning","venue":null,"work_id":"ffa0f8ee-b539-42c9-8321-5722001075bb","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.247322Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:45496fea40dca7f098d99ffbae039f3938ba95dd16bff5f029a9228acd51999e","observation_id":"875578ae-d670-4d24-a181-b266a7f3887d","resolution":{"observed_at":"2026-08-11T04:32:45.240567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.226418Z","title":"Mean average precision map@k metric explained code","venue":null,"work_id":"d6df47d2-c4d6-42b0-af8e-316bb5a16c33","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.250616Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:bcdd7e695191d4c7c561219227d3eb9f277b6ea0d5214584d2e357b92cffe38f","observation_id":"e3af98b8-c68a-4ff9-a994-01a437976edf","resolution":{"observed_at":"2026-08-11T04:32:45.229970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.215521Z","title":"Instance-aware im- age and sentence matching with selective multimodal LSTM","venue":null,"work_id":"7fba30da-5762-4c8b-98e8-264a8d22f42a","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.253776Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:7eae976718ffb5ae8b10a7a82fc20054a9bd075d5b753e6436498d2eb4b56d09","observation_id":"eadb2934-3082-4975-8320-8af75c355b0a","resolution":{"observed_at":"2026-08-11T04:32:45.219450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-11T04:32:44.256855Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.256855Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:fd9732ee3140ea6f4c0c86617d5ad54b43a0f52408415118330863d32a28d932","observation_id":"997aa0cb-9f17-408b-b1a0-f8a892d9fe35","resolution":{"observed_at":"2026-08-11T04:32:44.256855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.204819Z","title":"A shared multi-attention framework for multi-label zero-shot learning","venue":null,"work_id":"d64c22c5-6448-4592-bfa4-83277a7b5c45","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.260734Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:df62ae795a7e9cf15b655db71c12728bb9c9908b99a87d43b7caa15c89e19f36","observation_id":"9ec5a05a-8bdd-4ae1-9026-fae029bf1a22","resolution":{"observed_at":"2026-08-11T04:32:45.208593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.193869Z","title":"Saliency-guided attention network for image-sentence matching","venue":null,"work_id":"58e4bb1d-4177-4c76-a913-da733d9723b3","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.264069Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:9fd7edecfd813f21f94ec4b0d2d236d311c96e379435341e02161bbaa8afb95c","observation_id":"3fa3cc9b-d828-48df-83e3-961b39cba4ff","resolution":{"observed_at":"2026-08-11T04:32:45.197759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.268216Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.268216Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:79ecca4635c02cac1fa09c4561834f4c8020f2fbf9da13aa12bb2612f18312a0","observation_id":"686a888e-1eba-4f25-8004-13e084b54a3f","resolution":{"observed_at":"2026-08-11T04:32:44.268216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.176560Z","title":"Billion- scale similarity search with GPUs","venue":null,"work_id":"52002c82-a05b-441d-8b83-0ea220037973","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.271625Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f930edcfcf6ffe423c1fd21eabcf0180fc8bccaebd80c84429a76e52238f6899","observation_id":"eafb4ef9-c241-417d-8886-47d9e74930e1","resolution":{"observed_at":"2026-08-11T04:32:45.180726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.166099Z","title":"Deep fragment embeddings for bidirectional image sentence map- ping","venue":null,"work_id":"76942500-d858-435d-8508-a2ae3bea71a0","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.274901Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:d176f453af0cd7619e84fe56c2ecb8c1050ce12c16a0f34ceffb1f4a24757d63","observation_id":"d8e8ddab-b78e-4966-b790-3786abc2f5d7","resolution":{"observed_at":"2026-08-11T04:32:45.169751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.278151Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.278151Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:146bb844938acffd1db5540735af4db9095e851ae4fe6d98ab1cc3dc9d49a6b9","observation_id":"21fc5f81-024b-4a2c-b6a7-7b36f78de260","resolution":{"observed_at":"2026-08-11T04:32:44.278151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-08-14T23:12:14.296355Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-11T04:32:44.281134Z","title":"Unifying visual-semantic embeddings with multimodal neu- ral language models","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.281134Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:85675cadb8c464d2c719356d175e7a2d79c2e0f12c077e511dc2938721316cb0","observation_id":"8a12dc4f-a81c-44cc-a008-49f6370ae8d7","resolution":{"observed_at":"2026-08-11T04:32:44.281134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.148783Z","title":"Shamma, Michael S","venue":null,"work_id":"bac1dd8d-e166-49f6-a81a-a51a7e809f23","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.284372Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:7e35b4873e4a076544e226652da15f333ba424fcc4ea9b7e228cc18de2ed1ce5","observation_id":"95c20d47-1580-4854-a49b-3dc08b8d5f11","resolution":{"observed_at":"2026-08-11T04:32:45.152272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.138178Z","title":null,"venue":null,"work_id":"3a1ccd4d-100d-4929-8108-c20eb378ecfe","year":1955},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.287351Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:741b52f08d58cac683a3222cb0e71b1b852cdc85b8e2138f65b6b8f59cd583eb","observation_id":"6df81d8e-eff7-40a4-a593-cdfc267d3d75","resolution":{"observed_at":"2026-08-11T04:32:45.141789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.127664Z","title":null,"venue":null,"work_id":"17631287-0b97-4f84-8c0c-e6f3b18fb6ae","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.290556Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:da938dd525155e1ee56fcf9e16a1bb0544c643537b1635d1eacbce52fbd99306","observation_id":"b3b67e33-dcd7-43e6-9c36-f586355d5870","resolution":{"observed_at":"2026-08-11T04:32:45.131234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.115930Z","title":"Temporal ensembling for semi-supervised learning","venue":null,"work_id":"9da1f81f-fad6-477f-9ac2-0a652d721b27","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.293820Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:9cdcd1f56b8aa8e5500508f5cafcebe17141cd8c96ca9a5886c88e146d0bae12","observation_id":"60c05cb3-e6c2-405b-af93-126efa21482b","resolution":{"observed_at":"2026-08-11T04:32:45.119941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.104168Z","title":"Pseudo-label: The simple and effi- cient semi-supervised learning method for deep neural net- works","venue":null,"work_id":"48d02ee2-c257-4e08-a331-a52f93e37fff","year":2013},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.296862Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:0f40a2f00b1291d66dc02f5b61a6bb5f48f2e98fda63140c594817edb36fa5d8","observation_id":"de4c5e1e-d551-435e-a233-d19e650eb4ce","resolution":{"observed_at":"2026-08-11T04:32:45.108387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.093506Z","title":"Stacked cross attention for image-text match- ing","venue":null,"work_id":"04f6aef1-4bd8-467a-a015-1688d70bcb5a","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.299959Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f1e62812db48cbab84a688f3481f8fb3a02dd79cadfb57f1fe1af76878177fe8","observation_id":"e3ead0e3-686a-4c35-89a1-81cc86ebb2b4","resolution":{"observed_at":"2026-08-11T04:32:45.097553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.083122Z","title":"Object- centric open-vocabulary image retrieval with aggregated fea- tures","venue":null,"work_id":"a8bae8e2-4310-4a29-949a-219079de988d","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.303233Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:51f34d5102089a3947d50d085bf97099999aecee123340ba797902d5d56b923a","observation_id":"9dc3596a-371b-4a4f-9ae1-751f4c6e4a23","resolution":{"observed_at":"2026-08-11T04:32:45.086738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.062893Z","title":null,"venue":null,"work_id":"d84ba3ee-0951-40f0-94a7-5a00e22897a2","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.310751Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c12aaa0df83d6b9c5a3148682e63f698ed79b8f076bbb42acfe732db41aa8970","observation_id":"146a311d-96ca-4ecb-873c-1483b1c4eb96","resolution":{"observed_at":"2026-08-11T04:32:45.066222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.314386Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.314386Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:eca87d99ec0fe0b95dc2c55dafc2498ca996f7650c5a9312ee8e08c2d415f389","observation_id":"e34b8b82-f596-4a95-a4ee-346ed7268fc4","resolution":{"observed_at":"2026-08-11T04:32:44.314386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.046022Z","title":"Selvaraju, Akhilesh Gotmare, Shafiq R","venue":null,"work_id":"99e5f420-5b69-4145-a38d-ff98d2c09aac","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.317593Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:073dcd211791dda7266c681dece2ed9045f8a86e049cfed254bbbaf68c61ae65","observation_id":"59b5766e-5fd1-4b2e-b8f9-6b2f750695a0","resolution":{"observed_at":"2026-08-11T04:32:45.050149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03647","last_updated":"2022-04-07T17:59:38Z","snapshot_observed_at":"2026-08-15T15:16:19.201508Z","submitted_at":"2022-04-07T17:59:38Z","title":"Adapting CLIP For Phrase Localization Without Further Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03647","snapshot_observed_at":"2026-08-11T04:32:44.321352Z","title":"Adapting clip for phrase localization without further train- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.321352Z"},"links":{"cited_paper":"/paper/2204.03647","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:036a57fd6c91215aa8163c52b31d763a04aa79193b3e6bf674928d04a5e391d1","observation_id":"fd915810-0a36-4df9-a6ea-3e382c155e70","resolution":{"observed_at":"2026-08-11T04:32:44.321352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.035524Z","title":"Visual semantic reasoning for image-text matching","venue":null,"work_id":"052faca3-9d04-42de-a96f-8e1eb601cca9","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.325446Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:86f5f9a94062347d918703a81bb53e76abc6d97ced6d5b64fbd43d381f57d7f1","observation_id":"d046fad0-f1d1-480c-8022-6a12fe3da4a4","resolution":{"observed_at":"2026-08-11T04:32:45.039224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.023949Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"ef6ebb22-9b5d-4b12-878a-4767574c6445","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.328831Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:eec77f84acc176a2df964cad822d670becdb2fdab64d449c35d1b332ae9c2bd6","observation_id":"73bd46c6-5fc3-4ab1-a26a-26cf35164df4","resolution":{"observed_at":"2026-08-11T04:32:45.028368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.893817Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"1ba15eb6-c8ae-449a-b559-38c5fbf832c6","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.336016Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:aa057e3188807dade52a4e89a91446f9d6dfc63d4f7d045cca44015ddb39578f","observation_id":"a9d6e88f-414b-42f1-b0b8-507a899234a1","resolution":{"observed_at":"2026-08-11T04:32:44.897271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.883520Z","title":"OVIS: open-vocabulary visual instance search via visual-semantic aligned representation learning","venue":null,"work_id":"ee33ee1a-dfa8-4e71-9043-e4cb97a893ae","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.340173Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:55939d3a3a878e0a467b9d12f00c31bb7ddce88bc7bb5430cb5a93ea28e85c30","observation_id":"2b349096-06b7-42cb-a4c6-9cb48cf6f698","resolution":{"observed_at":"2026-08-11T04:32:44.887428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.873680Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"c5a787e6-a90b-4253-95b7-2d5891b822e5","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.343611Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:37afff4617dc63a7827ac4cc1c207cd350cb63771fd5b10bdc33e4ee1b16bc31","observation_id":"16a27aa1-d413-4d77-8973-cf788d4a5f0c","resolution":{"observed_at":"2026-08-11T04:32:44.877132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.863752Z","title":"Simple open-vocabulary object detection with vi- sion transformers","venue":null,"work_id":"525b93fc-e1e2-4314-8cae-a8ed8a3dad3b","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.347063Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c1dcbc3da6cccb103b5d4b3a920158701a79b8f17bd8809f2dc8bdcd682970a8","observation_id":"d94d9d91-28c5-4225-994f-2c6853b905e0","resolution":{"observed_at":"2026-08-11T04:32:44.867278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.852631Z","title":"Gritsenko, and Neil Houlsby","venue":null,"work_id":"50490b0a-a57c-49c2-a130-b341d98d14d5","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.350738Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:bceefa5fa3d044a425143a66078b5b34701f7e2d4ec7204ec43d6e30d7c2ad89","observation_id":"7588f2e9-508f-4bb2-a304-3e9c275e8002","resolution":{"observed_at":"2026-08-11T04:32:44.856527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.841695Z","title":null,"venue":null,"work_id":"50b1a18a-2431-4d8e-8cec-6b2fae7528cd","year":1999},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.354036Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:ce5766c1784026d0ce703bc860032d5e144b23df749f374b6f9aa869c5bcdf82","observation_id":"5bf0f9be-7dff-4b7f-8e14-5aa812923dba","resolution":{"observed_at":"2026-08-11T04:32:44.845186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5650","last_updated":"2014-03-21T23:47:20Z","snapshot_observed_at":"2026-08-14T23:50:57.448947Z","submitted_at":"2013-12-19T17:30:31Z","title":"Zero-Shot Learning by Convex Combination of Semantic Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5650","snapshot_observed_at":"2026-08-11T04:32:44.357178Z","title":"Zero-shot learning by convex combination of semantic embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.357178Z"},"links":{"cited_paper":"/paper/1312.5650","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a908ef55b5137ba794a7baab29548eff500d4b4e6c0a42c0f8c5b485414cd90e","observation_id":"09142528-ce7a-4f0b-ac31-6b5639a54405","resolution":{"observed_at":"2026-08-11T04:32:44.357178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.831150Z","title":"Meta pseudo labels","venue":null,"work_id":"225abe3e-6c45-473b-b876-73eede8ceb46","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.361301Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:7bb4dc95dbc79abca6c6bb4ddccf67c8f9365cb688af635b9315dd19a514353b","observation_id":"1fc4f01e-9860-440f-ae21-fb0089197ab5","resolution":{"observed_at":"2026-08-11T04:32:44.834732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.819947Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"bfbbb309-de34-4c7e-9bbd-da85b51ad22b","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.364047Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:bc8fb3f8ca3deb0288e532ef67b192250acb441615afa927a2f4046b1ac87801","observation_id":"3fa9b5d8-4ad4-4319-8180-845013a1315b","resolution":{"observed_at":"2026-08-11T04:32:44.823825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.809165Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"23f07da8-4463-4779-ba1a-75544467ee75","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.366883Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:ba3b32a6dcffadfd830015ebcb545db618e0a691931af32d6dd6b45b403a94a9","observation_id":"8279678d-be3a-4a0f-907b-8b02f10f7380","resolution":{"observed_at":"2026-08-11T04:32:44.812922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.797723Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"f04108ec-ed55-4d92-95e4-b684366bd32f","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.369964Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a4d7b9302514d4653638c121097eceaf16c19de5fb790d81a1dbaf502628c572","observation_id":"32507526-2ecc-4074-846f-32b1062fe148","resolution":{"observed_at":"2026-08-11T04:32:44.802015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.372916Z","title":"Regularization with stochastic transformations and perturba- tions for deep semi-supervised learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.372916Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:97b3a1e0634443241c5591d69c61e37a42c5da13dd759034df5cde5338940940","observation_id":"344bb416-94ed-4c4b-afe8-07253d2c8211","resolution":{"observed_at":"2026-08-11T04:32:44.372916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.779995Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"346f145b-dcf6-4386-b831-79a2044ffb24","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.376152Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:7a48971d362b616a0dfc316fd30a6b7b8d91f18d29fa6a0a1a23507416f82896","observation_id":"f9390e8f-d0e3-4351-a377-a724965289cc","resolution":{"observed_at":"2026-08-11T04:32:44.783806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.379094Z","title":"Fixmatch: Simplifying semi-supervised learning with consistency and confidence","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.379094Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:960effbcf5257e568babbf3c8f3d1a56404e0cb87c3be4b4468c5d359afea96d","observation_id":"709102e8-1cd6-4c97-8075-a6903002902b","resolution":{"observed_at":"2026-08-11T04:32:44.379094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04757","last_updated":"2020-12-03T04:12:25Z","snapshot_observed_at":"2026-08-09T05:19:02.818950Z","submitted_at":"2020-05-10T19:15:51Z","title":"A Simple Semi-Supervised Learning Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04757","snapshot_observed_at":"2026-08-11T04:32:44.381983Z","title":"A simple semi-supervised learning framework for object detection","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.381983Z"},"links":{"cited_paper":"/paper/2005.04757","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:8ff3c337d1948dbc0edf434998b8c28f5b615c473f179784708a68e5446fac2a","observation_id":"0a9d0bf0-888d-426d-89a1-2fc076229288","resolution":{"observed_at":"2026-08-11T04:32:44.381983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.762087Z","title":"Dualcoop: Fast adaptation to multi-label recognition with limited annotations","venue":null,"work_id":"0c8c5c53-dbcd-4f5e-a0ba-6b35f14fcd04","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.385620Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a6bbe13e2785115d0af4515307e7d515b298e64e903d323e5016ded3a2d8fe60","observation_id":"ea46336a-b1d4-4448-9650-8cdf05a0cf7b","resolution":{"observed_at":"2026-08-11T04:32:44.765945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.751417Z","title":"LXMERT: learning cross- modality encoder representations from transformers","venue":null,"work_id":"c3710603-027f-4e18-bd22-4c0c8d1417bd","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.388942Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:058781240319a61f4f4d97b0cbe733cd5515c8986a3d5cd3d02afafe254676e6","observation_id":"4b43bf7a-9756-4073-aead-773778dcfe73","resolution":{"observed_at":"2026-08-11T04:32:44.755377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.740238Z","title":"GIT: A generative image-to-text transformer for vision and language","venue":null,"work_id":"4064926a-739c-4e4d-a2be-9e4dbc008547","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.392434Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:64f047dfd8bf8a3c3a47207d08448f0f7e0852ff963d3fd75829f83df662008b","observation_id":"c7ad6b8d-16d5-47a5-a1e2-e70438683180","resolution":{"observed_at":"2026-08-11T04:32:44.744179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.729598Z","title":"Object-aware dis- tillation pyramid for open-vocabulary object detection","venue":null,"work_id":"d6d4e53d-481e-4f92-9464-7be49ceb1e54","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.395836Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b6e1d24bfc313beb02e35bc596bf89689e8c07b93746db59d91eb221f14159cd","observation_id":"ef0f87d3-b8a2-405e-a4c5-f16b7fdc7551","resolution":{"observed_at":"2026-08-11T04:32:44.733306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.399222Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.399222Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:19ce236233a6c415b90b0bd8dd21802d460bd9fec8e6b11d401021a13c745a56","observation_id":"a81d8b9c-e971-4e63-a19f-8ba16a6494e7","resolution":{"observed_at":"2026-08-11T04:32:44.399222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.712755Z","title":"Aligning bag of regions for open- vocabulary object detection","venue":null,"work_id":"31740eee-bda7-41e7-85b0-53e4ecd811b9","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.402977Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:11929583f6b80e57b46ac6c190fbefad12ab11d9224b618b893340342bf11799","observation_id":"49996732-0701-4f2d-9d60-70578c39dc16","resolution":{"observed_at":"2026-08-11T04:32:44.716100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.702951Z","title":"CLIPSelf: Vision transformer distills itself for open-vocabulary dense predic- tion","venue":null,"work_id":"8678d3c2-30f1-450b-82a3-106b8f501ed3","year":2024},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.406238Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:e50015675c7f54ea2da104dd348fa70d99e3733750c7a77a8119dc57063fbb85","observation_id":"498f067e-e35f-4230-8853-ecb759bcd7db","resolution":{"observed_at":"2026-08-11T04:32:44.706543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.692722Z","title":"CLIM: contrastive language-image mosaic for region representation","venue":null,"work_id":"ded4e684-ba29-4eb9-9126-12a8d63a9463","year":2024},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.409651Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:8bb740caeacf54bbcedf57f9d1fe20fa43bba6613563af9959370a7d59361f1f","observation_id":"81b8bdef-5eb0-46d9-9bba-cabc7ba1b374","resolution":{"observed_at":"2026-08-11T04:32:44.696334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.682787Z","title":"CORA: adapting CLIP for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"2f830d69-ed6a-46f8-b1fe-a4ffc81e58d3","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.412748Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:491b321c8023cf84f272cd5db059ba4a2d59b656f235b0e833a6f0fc4ca0b03e","observation_id":"580337d6-a7cf-4fc9-b58b-182f5997df2c","resolution":{"observed_at":"2026-08-11T04:32:44.686378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.673211Z","title":"Unsupervised data augmentation for consistency training","venue":null,"work_id":"7fe94f48-65e6-4a26-828e-3b16a12b5ef8","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.415985Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:3323d60b5695ef60971cdbab2e960abf308cd0e14a1ea7fa1c7920084759384a","observation_id":"700ef036-57bb-4c77-ab99-8e0878c5917f","resolution":{"observed_at":"2026-08-11T04:32:44.676599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.663353Z","title":"Self-training with noisy student improves imagenet classification","venue":null,"work_id":"e623ac99-3f69-44d8-aa05-6adc421dc4d4","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.419323Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:37a52803f13d6023f4d01f4b89c279ad176470433bca1ad25077a7feba9bc4ba","observation_id":"b744b86f-6194-4436-b81d-dd6704429373","resolution":{"observed_at":"2026-08-11T04:32:44.666904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.654059Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"c6698bdb-05e7-46ed-959b-2c11b9f95f52","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.422649Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:cd81af764d55dc07575d05481c9366929a09a95bd336f0fa7e5fe6ae90de7b29","observation_id":"048912da-d9df-44e4-b709-f355f2b41bd4","resolution":{"observed_at":"2026-08-11T04:32:44.657502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.644064Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"3a2f3dab-b7cf-45a3-8dbc-f7f71f8b6ee4","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.426262Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:eae217f623d50459130e41ab0d400dab652b1cef8bf33787ddf11f53797d24b0","observation_id":"bd62beab-7379-4888-8130-214531072f82","resolution":{"observed_at":"2026-08-11T04:32:44.647759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T04:32:44.429626Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.429626Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:59c93c10be61fad3e146ac8dc6c1a37b272a87cfcb1f9f264e2c9f5be94822a4","observation_id":"b4d89a9c-6988-460f-b56c-92e848b601fd","resolution":{"observed_at":"2026-08-11T04:32:44.429626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.634170Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"41851213-8623-4934-9b71-eed4a43f7ec8","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.433395Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:db08f7b6e5868f6c2b507803106b13ff1ef19445a7e65c76c8dbb53b8ecc30a1","observation_id":"d208642c-8131-4507-af4f-51998798543d","resolution":{"observed_at":"2026-08-11T04:32:44.637917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.623722Z","title":"Fast zero- shot image tagging","venue":null,"work_id":"97d1d89f-6264-4c35-9755-fc2509fab5f0","year":2016},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.436720Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:fe54717fe09c569aa8d22f89db5695ebfe15cafa26bc37d44bb3294fae427ec0","observation_id":"ef404a21-badb-4213-b54b-cac7d18684fa","resolution":{"observed_at":"2026-08-11T04:32:44.627313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.612658Z","title":"Exploiting unlabeled data with vision and language models for object detection","venue":null,"work_id":"3e4a155b-b827-4131-93c6-ad9b67058724","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.439922Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:538acfc7108a58faba12144ecc5d64b8f77d75e9cb6b88034e5c25122a841335","observation_id":"ee36940d-78f8-4565-a92f-1b331c27776f","resolution":{"observed_at":"2026-08-11T04:32:44.616505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.601808Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"b61b4e01-6545-4a97-b4d4-9f94830d1450","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.443115Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a7f13931f6a80f0b2ab1db6dd744ebff8e89418eecbb3d62be59d9fb6c01267e","observation_id":"e2e330fd-2ab1-4fbe-94ce-3da4a3e6a41e","resolution":{"observed_at":"2026-08-11T04:32:44.605565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.590554Z","title":"Extract free dense labels from CLIP","venue":null,"work_id":"60b2c7a2-845b-4487-b7c7-192cdcf16359","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.446293Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:e6563d75c44ce0251867aeaf39fbd29da76ff4a939e5a857ff862b81f3ce371e","observation_id":"b62ee730-0a93-42a7-87f4-f0bb529cb6f6","resolution":{"observed_at":"2026-08-11T04:32:44.594224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.579731Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"f22d69c3-60ed-4b7e-b260-1a387226a850","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.449513Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:99b9b049cc3d134a8634bff64072ce8e1654b8b8160d29609261c07e00af9cb2","observation_id":"eb1e4021-4501-4b31-ad38-015d563c7db8","resolution":{"observed_at":"2026-08-11T04:32:44.583536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.569525Z","title":"Semi-supervised learning literature survey","venue":null,"work_id":"3b9813e7-1fb1-4b42-a31d-676975b4ffc2","year":2005},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.452756Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:81d9f75e3ef69a95e9dcaf069e06319338c50c8f5ee3cdc5557223bbf93da498","observation_id":"95111b72-017c-45d8-bace-6ee30db8b557","resolution":{"observed_at":"2026-08-11T04:32:44.573034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.557491Z","title":"Rethinking pre- training and self-training","venue":null,"work_id":"23312b2c-a39b-4874-9499-791f804730ed","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.456090Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:301e394d26371cd8d8249f4e48d5fb66162a78b0d22fa2731b6ef7a56048800a","observation_id":"351aa591-742d-4d2d-89d0-32ec6b46c002","resolution":{"observed_at":"2026-08-11T04:32:44.562509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.545975Z","title":null,"venue":null,"work_id":"f8575864-5472-4969-b898-6130d3ac39da","year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.459932Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:ff6d681232a9174bec4859e7140192a59b1c94940e2d16697c6fe571448c8af9","observation_id":"e59c07a9-5278-4433-89ee-a27e483a05aa","resolution":{"observed_at":"2026-08-11T04:32:44.550453Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.903544Z","title":null,"venue":null,"work_id":"2cf10949-9764-4f0c-9a89-f8058a8b8a5a","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.332198Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:093757aead2f0cdf2fe74ea27293547a4212c819dc0d2bc8220deb8aef132860","observation_id":"bf8ebb87-d2c6-425d-a6f2-0de489193ef3","resolution":{"observed_at":"2026-08-11T04:32:44.906987Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.072608Z","title":"1, 2, 3, 4, 6, 8, 13","venue":null,"work_id":"f186bcd1-1b7d-4b3b-a4f2-ae69e426e69e","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":608,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.307277Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:9690452ecff739db2ba1b627322caf7d89e6c44f3d96ab74ac9eb24109ff28ae","observation_id":"c7121743-9217-492c-aba3-3e4c4fe05e1a","resolution":{"observed_at":"2026-08-11T04:32:45.076156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.180725Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":6086,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.180725Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a0c2fb11d5cad2a3703906a47f0c48f6bac478065b3665b1a2518bb03c9a6c70","observation_id":"17f61c72-0b65-4ef8-9c9d-831b1e11f4cd","resolution":{"observed_at":"2026-08-11T04:32:44.180725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2412.18806."}