{"as_of":"2026-08-08T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca1b931460deedf59b79728263a695d0e7470028ed2f62b8979b65f6d62f3172","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:31.900376Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24441/citation-record","integrity":"/paper/2505.24441/integrity","json":"/paper/2505.24441/citation-record.json","paper":"/paper/2505.24441"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:35.367335Z","title":"X-detr: A versatile architecture for instance-wise vision-language tasks","venue":null,"work_id":"da18e7d3-58f3-42b0-b57b-71b8a9d8675a","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.762549Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:6a45a3d096c27f036a2614db52a7f8740cefca0d7a395a2871ee18c2f7a73d57","observation_id":"5acbcf90-cf7e-4d06-b3de-ba888e6a9bfb","resolution":{"observed_at":"2026-08-07T12:27:35.456632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:27.837332Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.837332Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:1ac3b5c9fb0cf5b66c25d66224070e8b5fca90fe45c453016a676b81d35c2006","observation_id":"f32e6da4-2021-479b-9e9e-fcaa91e5a35b","resolution":{"observed_at":"2026-08-07T12:27:27.837332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:35.127865Z","title":"Learning local similarity with spatial relations for object retrieval","venue":null,"work_id":"91a6bcdb-d0c2-420f-9e97-4480e47919af","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.933126Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:91adfea21b8f0be084880d53ca042dad4256f63a486dccd9987c3a58f7b0725c","observation_id":"9387a1d4-f76b-4651-820f-fe0187b64db0","resolution":{"observed_at":"2026-08-07T12:27:35.249664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:27:28.026719Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.026719Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:09cdf5a50049e013d37591799887632c6f3ba5e272a5347e105434b6e4593f34","observation_id":"082977d1-44db-463c-a5ba-4a4e62f6ed8b","resolution":{"observed_at":"2026-08-07T12:27:28.026719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.128917Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.128917Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:742a8942c6b412b1979cf893976a5c023c0bb0355896cef5fba070d2377fdc00","observation_id":"5bd15887-e3ae-427e-90c2-d45e6b7eaf93","resolution":{"observed_at":"2026-08-07T12:27:28.128917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:27:28.204348Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.204348Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:00b406232eee5ba0c1dff9856ebbb050a13eb5020e17cc5b77493d0c45b909ea","observation_id":"d3838025-9c10-4428-a4b3-b08ff2acc72b","resolution":{"observed_at":"2026-08-07T12:27:28.204348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.295713Z","title":"Efficient diffusion on region manifolds: Recovering small objects with compact cnn representations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.295713Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:219876a16fb19b12d5327ff2bc96120a1708086a8317484828d01c26179fa034","observation_id":"afb5e2b4-a51b-438a-b829-241e933bcf21","resolution":{"observed_at":"2026-08-07T12:27:28.295713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.391753Z","title":"Scaling sen- tence embeddings with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.391753Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:2cafabac77f488c4de6857b13f5e4f19412d8d621532183f80f5ac5326bd2313","observation_id":"75a1b733-ddb9-48e8-8168-a90b202f97b9","resolution":{"observed_at":"2026-08-07T12:27:28.391753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T12:27:28.457180Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.457180Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:5b90960693639d632f2e91b9bf209ad277e383ef7f5507ef86ff6e745bf07c98","observation_id":"f1d3f6d5-968a-4429-a8d9-9bdfe5c71934","resolution":{"observed_at":"2026-08-07T12:27:28.457180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.549834Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.549834Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:2aa6f9b0feacdafc93646a6ea391e5df5ed449153bf9b200f59acdb822056e09","observation_id":"786e7fc5-0611-43ba-bb1d-80d72bde548b","resolution":{"observed_at":"2026-08-07T12:27:28.549834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.912894Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, 2024","venue":null,"work_id":"b78912f1-cb57-4f82-9847-f7d972d2cb19","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.617327Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:9f125fb629d90e2ce5518f653072c29680e46793f1d3bbe4e1da5ac6badf1807","observation_id":"fb7b339f-9a49-46f0-8d2b-a784f67123e2","resolution":{"observed_at":"2026-08-07T12:27:35.003420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.735559Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.735559Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:dc39d42a080c501234323eff80aeaf3a0730baa8f0821e7c4b20beb6d0fee10d","observation_id":"b6a7c232-f9ac-420e-b419-9c6133a1cad1","resolution":{"observed_at":"2026-08-07T12:27:28.735559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.721939Z","title":"Percep- tual generative adversarial networks for small object detection","venue":null,"work_id":"92887e75-972e-4586-9a96-0d0af059ca71","year":2017},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.794418Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:1b30b2e78da7d4f006bcaa620af0e39f1089cb1f005127785b00d93e0d12201f","observation_id":"8a0f6620-4a1f-4694-a4de-327eb677aca7","resolution":{"observed_at":"2026-08-07T12:27:34.804899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.566960Z","title":"MM-EMBED: UNIVERSAL MULTIMODAL RETRIEV AL WITH MULTIMODAL LLMS","venue":null,"work_id":"ccc751cd-b52a-48e0-b641-c1fe6a2e2c05","year":2025},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.868805Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:57e54c69be16fe45f36918144c606179a3887be5b66af5fe9b1b1ed047a2fc32","observation_id":"035a3965-b246-4700-9d7a-e32a1707cc87","resolution":{"observed_at":"2026-08-07T12:27:34.608257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.461223Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"150047ad-cc6c-45f0-b3d2-464022d7b6eb","year":2014},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.979561Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e8d0888426a554f7a42bd99031528fd721eb4915236ad58e8e2834dc8bbdd5fd","observation_id":"0493bd73-1f8f-4ed4-aa54-f3031d0d9c89","resolution":{"observed_at":"2026-08-07T12:27:34.513467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.076060Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.076060Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:ca666ad8555e448f64e9fb01fd560fd9411a9905e72cdc9ab3a5669129b53974","observation_id":"afa3afed-c927-4c34-902d-16570e92d1ec","resolution":{"observed_at":"2026-08-07T12:27:29.076060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.154729Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.154729Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:8f3a8af02c3927b9d237719d48232a02f6d6c2bc65a48aaa56b5754e3744968b","observation_id":"faecee95-0ffa-43cf-a949-802bba27e520","resolution":{"observed_at":"2026-08-07T12:27:29.154729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01720","last_updated":"2024-12-02T17:10:16Z","snapshot_observed_at":"2026-08-06T20:25:23.859209Z","submitted_at":"2024-12-02T17:10:16Z","title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01720","snapshot_observed_at":"2026-08-07T12:27:29.242591Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant.arXiv preprint arXiv:2412.01720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.242591Z"},"links":{"cited_paper":"/paper/2412.01720","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:b204dcfd37122c39a855e464c48e22d28bb3d97561672386b4ff1bb9128e5b0f","observation_id":"08c2aaaa-3685-479d-929b-8fa04af701f0","resolution":{"observed_at":"2026-08-07T12:27:29.242591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.376486Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.376486Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:3d8f6bfe49c46ba776a765f5bfb933d4f7e1646890d7fbfd043daa3bc23364ff","observation_id":"9e4d2ed3-ca1e-4ae3-ba0d-261cb8c01d88","resolution":{"observed_at":"2026-08-07T12:27:29.376486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.268994Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"19d2d1b7-2f4f-4987-9cc9-4592a24160fd","year":2021},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.463564Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e8797db2263df21f781467c0a84bbb6c401c87cd2a4cbebec24ee008fe72bf91","observation_id":"4a131a72-e5dd-401f-b056-33755cf988e6","resolution":{"observed_at":"2026-08-07T12:27:34.327250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.576850Z","title":"Scaling open-vocabulary object detection.Advances in Neural Information Processing Systems, 36:72983–73007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.576850Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:20b44a58804a44a22d7e88b02324f04e96551c2915dc0fe6e35bda884a7ffa95","observation_id":"d92e25eb-5287-4d27-96fa-15c807dd1afe","resolution":{"observed_at":"2026-08-07T12:27:29.576850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.091682Z","title":"Better to follow, follow to be better: Towards precise supervision of feature super-resolution for small object detection","venue":null,"work_id":"78185015-4c99-44a6-a67b-89f7fd474a7c","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.748307Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:b618e36ca5f782b8d4e60aafecc58bf8dab992b914cad9ac9a7b07cf43ceea0d","observation_id":"fb909ef7-ae4a-41d8-93d6-8ffaeb99cdef","resolution":{"observed_at":"2026-08-07T12:27:34.192178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.942622Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"f8d83fbf-8a15-48d2-97ba-4c94f262d255","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.838548Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:3347a602d1c42d6b5d118729fbeef580b4335f41727f763607f20773abad4fa7","observation_id":"b4ff8d53-7421-40ef-9996-2c15b562cfd0","resolution":{"observed_at":"2026-08-07T12:27:34.006100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04378","last_updated":"2025-05-08T19:16:29Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T17:54:27Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04378","snapshot_observed_at":"2026-08-07T12:27:29.993325Z","title":"Discriminative fine-tuning of lvlms.arXiv preprint arXiv:2412.04378, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.993325Z"},"links":{"cited_paper":"/paper/2412.04378","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:ea2cfd63e380a48a1b10dad29f7b0aa24bf6da430fb3083555abe2f5cc05f3f7","observation_id":"f75c1ba7-8550-4fc1-8cae-28f0ebf1bd75","resolution":{"observed_at":"2026-08-07T12:27:29.993325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.084532Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.084532Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:43f72c5414207d227a7f6124473e1ce10483426ceddf3211d42db01a06b0d73c","observation_id":"05149fda-196f-4cae-89cc-2e2e14a27fca","resolution":{"observed_at":"2026-08-07T12:27:30.084532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.771081Z","title":"Dino-x: A unified vision model for open-world object detection and understanding, 2024","venue":null,"work_id":"0b987e44-fcd8-40be-bb7c-e1dfa87515db","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.158337Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:c91971847b0411cc17a83e74841f3910c1db52a28c630d46fc4b7f7bf8ce2120","observation_id":"31ce158a-37cc-406d-bdd9-18a8a77ad55c","resolution":{"observed_at":"2026-08-07T12:27:33.867265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.606067Z","title":"Small-object sensitive segmentation using across feature map attention.IEEE transactions on pattern analysis and machine intelligence, 45(5):6289–6306, 2022","venue":null,"work_id":"951ea910-d26b-4179-bd7f-e1cfb564aef2","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.248229Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:9f23b5af869fec9b2704eee9630dacd56fd847e787aa1c44e9e80de8cf819289","observation_id":"c8a04ad2-a163-4499-bcc0-a5353dcccade","resolution":{"observed_at":"2026-08-07T12:27:33.693837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.439618Z","title":"Image retrieval for image- based localization revisited","venue":null,"work_id":"cdf2d0f6-1019-4d26-9117-f173f88a0e4b","year":2012},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.352962Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:3d4cc4ce6d89b4eea586ee77b7bb49f5a3bc892bd1c0922f3eff3113c32649bd","observation_id":"35b687a2-3862-4606-8873-612e4c0291a6","resolution":{"observed_at":"2026-08-07T12:27:33.502070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T12:27:30.439237Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.439237Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:c1fb8ed769ee42b3bcfa443542454d5ebd83116bda989e04d6fa6aa67f5d8626","observation_id":"855e13de-0145-4680-bb36-e5ec5006213c","resolution":{"observed_at":"2026-08-07T12:27:30.439237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.295599Z","title":"Miss detection vs","venue":null,"work_id":"0d2be7c8-5958-4d3e-a66a-975630596d4b","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.520532Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:b15343ef4bd7d149d886f6d3b210bd55c3140e4fd39ca30aafa7bc62f274b5c4","observation_id":"2be028a4-f85b-4b14-8ddc-729dfe973335","resolution":{"observed_at":"2026-08-07T12:27:33.379077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.158126Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"3cc80819-85b6-41fc-b53b-95545d224c97","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.642548Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:cf98e0c7543f6a17a2b0969c2ebede0f3a445269005859e080df3c475338364d","observation_id":"098cba67-c06a-4240-8829-9ea0945a0440","resolution":{"observed_at":"2026-08-07T12:27:33.219619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.759861Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.759861Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:c5bbea198e33436e184fe0cd059b7fa28b4e5770e131c393b48b6346ac259500","observation_id":"98227880-d02f-49b8-9879-a12f90142d59","resolution":{"observed_at":"2026-08-07T12:27:30.759861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.838873Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.838873Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:a0331a7193105d60325089f6c2f36ecfb44a7ce1d96820366cdfbd5fcf1826e1","observation_id":"379019e9-0448-49de-9fb1-cf557d1cecf0","resolution":{"observed_at":"2026-08-07T12:27:30.838873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.900052Z","title":"Described object detection: Liberating object detection with flexible expressions.Advances in Neural Information Processing Systems, 36:79095–79107, 2023","venue":null,"work_id":"db1eacf4-c5b7-4009-859a-44ca4093ac8f","year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.903267Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:13a758e8419b4bf3c7a3b389abd36135c70b2aa7d0699ba99321068bd0226df7","observation_id":"485bf210-903f-4d24-a5f7-c2ce8ff02b0f","resolution":{"observed_at":"2026-08-07T12:27:33.008238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.694893Z","title":"Querydet: Cascaded sparse query for accelerating high-resolution small object detection","venue":null,"work_id":"fb24d4c5-df67-49af-bbb9-864434d4a9ea","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.987407Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:72a4324198129a5db2942905d543ca87a68088378ed27bb5ddd0b448e7f97f67","observation_id":"805ce06b-6f2a-4379-bf0c-632ad6d7b6dd","resolution":{"observed_at":"2026-08-07T12:27:32.813662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.099504Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.099504Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:1ac11678bf8ad4605e5024299c564e4c97b140640e595db12db9e76b1b7e7737","observation_id":"036e2909-c154-4e1e-8401-ca7a96da7bc7","resolution":{"observed_at":"2026-08-07T12:27:31.099504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.173327Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.173327Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:8ef6b3c69df5717725934f9bf2b3a978e22365abcde09d074162a3c2e61b3e18","observation_id":"cd9e4d0e-0d54-4216-8cfa-e18dac7098e2","resolution":{"observed_at":"2026-08-07T12:27:31.173327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.311495Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.311495Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:6ed1cb8dcebbe48581a4381094610307fc82c7ed2b98cc5904c159e7c937559f","observation_id":"eb48f2dc-991f-4d69-8861-9f1063a0235e","resolution":{"observed_at":"2026-08-07T12:27:31.311495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.530724Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.530724Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:b8eba5acd3c5a645acd9af070a902baea22021c4f25524a13f201b8d3284c2d9","observation_id":"513f8cbf-138c-4b0c-b682-9822fcc6700c","resolution":{"observed_at":"2026-08-07T12:27:31.530724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.647153Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.647153Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:cf203d9a96af7169d1a46a44d3092b71126e7a72732f8dee3941a75004fe2b52","observation_id":"2d6ac876-1bf0-4d7e-b860-dea9d3e4042e","resolution":{"observed_at":"2026-08-07T12:27:31.647153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-07T12:27:31.738988Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms.arXiv preprint arXiv:2412.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.738988Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:5727312f9a0040e42e4bc5d4ae68425a95755f3552e0397e762b093cdabc9915","observation_id":"69637d68-5504-445c-a0b9-8cbbb00a66ce","resolution":{"observed_at":"2026-08-07T12:27:31.738988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.371988Z","title":"Vista: Visualized text embedding for universal multi-modal retrieval","venue":null,"work_id":"6cb94b59-d8fc-4641-aec1-0332c2544851","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.818367Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:083c2f3bfc1d53da8c84b45c6f286080acbb0689569a5595bd007178c3c1160b","observation_id":"14c5c1ac-78b0-4090-b9b3-0fa678ce33bd","resolution":{"observed_at":"2026-08-07T12:27:32.534564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.196590Z","title":"Summarize the [main component/ background/ detail] in the above image in one word:","venue":null,"work_id":"c6f49bb8-b1aa-4e81-9295-67ecd8150084","year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.900376Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:97fea963a63154f290f906154e2db1498d0f3aee0278adb4fa775faab56b4bf1","observation_id":"7d8cf7c5-6a1f-411d-9632-00d2e5fea2cb","resolution":{"observed_at":"2026-08-07T12:27:32.235066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:20:02.883145Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2505.24441."}