{"as_of":"2026-08-20T18:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36d4bd65e38bd5571ce70a93d275db65f503995e65286e3f4fe195a1098f17a7","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:17:40.198357Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03184/citation-record","integrity":"/paper/2607.03184/integrity","json":"/paper/2607.03184/citation-record.json","paper":"/paper/2607.03184"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Langley , title =","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:e7fdbfdd5cc668914461c77394f3a9b07fefc55fd4e207d15c79dc4820f29016","observation_id":"3a646b21-70d6-4523-8a61-0b1756eb4978","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:c1d060fa7a34bcaceb8239c9de37fa27636ec7372206ca364b6ee1c227416a07","observation_id":"2f8f6c2b-78bc-4d04-88fe-41a98e6d1d92","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:37c71d98e32c8afff04be1a2c7430b939bd9d7285225fe215692830d5f55fa50","observation_id":"76c0dabe-fb38-47ec-9028-8b32ff63a715","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:f6d782f3a831dda4eeb7d86c72b5134c0d3137cb9ba8f0dc57e5db2743e9a59c","observation_id":"4b6b8368-8349-414c-b462-8e1be232883b","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:1ffa49e1c0102cb19a2ca60b8306a49d9c8c641ca0856a93391ac793d112fd3b","observation_id":"341a3663-d00c-4d98-8521-24c45cf3c0ed","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:757dd70c11bd3695ad9be06f0671531988024d4fbcf6b496b540e40488b3157b","observation_id":"a084518e-1193-4dc0-afdb-5e27937fd8c7","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Newell and P","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:bf8ef4f1862bcaed49abdd9ccacce7c5452a0dd87079ba2a4293dd714cbf1dc3","observation_id":"854beb85-a1a7-45a6-b658-731ee86b91cd","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:531ef500b9337ea2cf4ff40460edaa55d395307e2fd7f79851f519a7dab08998","observation_id":"ed87562d-4515-4b30-a64a-5e75b2066776","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2509089fbfce243eececfa37289c2bea6f1cbd6e9e1e10c147abd8edf86951c5","observation_id":"d4b82e96-3fa2-4228-9490-a63b993ac082","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:5bb285e08b2b8682d184723a6f1c3363262a69b83bbd41f69c2175abd1ad69da","observation_id":"27af8387-ad94-48db-b428-8fa43340f1da","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Journal of Foo , volume = 13, number = 1, pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:0b9ef117a462e50cbb9b27f226bc6769ac2cbe884ff319dbb9046a5b7165a017","observation_id":"e3421572-0323-4ac9-beb6-c04030a14476","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Journal of Foo , volume = 14, number = 1, pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:afcc160aafe3716f829ac2efaeefb92e8e5136fc61f6cc87e86ab0f268f7c28f","observation_id":"7b7c2425-f684-478b-b5ef-b47d997a6eca","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:a71012bf1ca6f1688f463aef2856694c8125e24d2bc41874881ad0ebc51f6d63","observation_id":"c0b97163-dbd9-44d8-b825-0002aad842bd","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:1532edfabd8d17e8a18b94439c2d213d24e03df67da584d3a12e11f6f831de9f","observation_id":"92729c7a-c240-429f-b73a-eabd9c5891a1","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9324a29f0b73d67745c2908d04d8b06a351d780cbc94d33f9ae87aa0a54f5e80","observation_id":"7197287a-0a3c-4688-bce4-cec0f473475e","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9d2d831a35a0f566c24126263d1175dfee3f326e8d1604bcd34bc095791ec5b3","observation_id":"94c943ad-58aa-4a81-9fc3-1f47d641771f","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08294","last_updated":"2023-11-14T16:39:38Z","snapshot_observed_at":"2026-08-16T14:43:22.585591Z","submitted_at":"2023-11-14T16:39:38Z","title":"Evidence of Hot Carrier Extraction in Metal Halide Perovskite Solar Cells","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08294","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2311.08294 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2311.08294","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2ed3693b6b7d6f935607f0245723f87c2424b3fe567b196fd7454ce4d903868d","observation_id":"18546856-ce7c-49f7-a7d4-69255cae866e","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:110b44ca5b4a082ee4401334e450129e3376557a9fecdbcbb1e520bd46428b20","observation_id":"08f17d34-a90e-4b25-97b0-2e30b0533be9","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2303.11381 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:af8b07a2665f2f9a9cd60e882c5c0c1d294ed76622cca6d89fd9d912e6d597bc","observation_id":"dd60f5f9-bbed-422e-b0fd-86d5c7e73880","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7afd02ba0843ed0c3acb398f51e772b692ea155b3253f0a335734a15e6f7d07b","observation_id":"2e8ba826-7b0a-4c9f-b3c9-d77e7643900a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:a93a21fbb0c2825581d62fd81ab7a83b2b432359ba56c3e9b149b681a65c4494","observation_id":"da307f99-5eba-4ba1-978e-5566433aa888","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09842","last_updated":"2023-10-31T17:43:39Z","snapshot_observed_at":"2026-08-18T03:05:32.170128Z","submitted_at":"2023-04-19T17:47:47Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09842","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2304.09842 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2304.09842","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:e6db095f02a2397232e59eb879e2b0b73ad8b2558e450fec9b1b24f608118a2d","observation_id":"0cb26989-f823-4cdd-9be6-da371b886e69","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:35c1954930edee357a30e604f79a45d08cd226018665403c8512081d66acae7c","observation_id":"429c4920-74c5-4e54-b0bc-dcfab1c6b8c7","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2306.13394 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:621e178483a3277c0f74986ff288445f7da98dcbaf7656e4dd088143c89520f6","observation_id":"af140d5a-c788-4515-8456-ad4834561744","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2307.16125 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:edddd4d1c5df45c66b7de9805808859706b8ac94374e2752b52baf99c52d1390","observation_id":"ffe33e09-244d-4f1a-8650-f34b6b39e8f8","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:17a57fadb7fe7d6c6b1e6e8cf67c0ccc08b7e386632b93766376993e43e37624","observation_id":"a5315f48-4958-4653-b481-c13fd9be5258","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:6ac1a3b8c7a551e366ea6a853485699ac960c5625deb4cc792ac988275e6f8b5","observation_id":"eee29fbc-9fa0-4847-a2bc-b671e6cc3f17","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:40b424ac1535be625365ed2140146e19aebd241887c0c4c14e03da5d41e2a69e","observation_id":"959c43dc-9cbe-46e8-971b-bcd61b6fb463","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01222","last_updated":"2025-05-22T15:55:37Z","snapshot_observed_at":"2026-08-16T12:53:43.590678Z","submitted_at":"2025-03-03T06:40:21Z","title":"Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01222","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2503.01222 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2503.01222","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:30a901e7b4b1b0f3c4a0c9da124da345a3912fe232cce59d94ed56cdab925c2c","observation_id":"c32f5145-e9a5-4c9d-a49b-0d5e6679c1bc","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d3f5f6a11a982c94cd8b21c99dbfdebbad0b69315dafda26a154ee34f662be07","observation_id":"9ec6d402-9dcf-46da-86aa-e6612d04366a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:23fdeb92e80dd7efaa80b1f29ba4d58e5b540d017205a0d507ab09ae12915bea","observation_id":"8d846ade-a06b-40bc-8aa5-a1e62ab27c4c","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:a3f8537caa619ae8e099fb96496f13a5d1600c73180f1c742251ee1951a29e47","observation_id":"a755556a-de9c-4d36-9a70-88eaf6e463fa","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2023 , journal=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:390187f0d79a1cba9c924c9a793a871cbf35100365a61fad2ab948d662c34df6","observation_id":"516b84ad-15e2-49fd-a3df-1c694ea93872","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:38ae76dd8321446f79a80f70f4031300c5a97b6387cc21fc19c30752b620e0cb","observation_id":"6301b4be-946b-4172-9eea-c4bfdb00bc5c","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ai , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:f8e70fb24cb5287fe45f3d76eb8e6129fc2a0bfd7f3d4f634064272a7a984bc4","observation_id":"6dd3732d-51cc-45da-8b36-c56902ead70d","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:85ee42bfc4a41a6ffaf735c3db6f42cae9dc675567f73a437d447403c39f5d22","observation_id":"4201c93c-8e81-4595-bcab-6b6fc662ee12","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2023 , journal=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:a9313c91abf99c04ffbc4d27b2cb6d6642e0752e093b3602d22271ac0b37a2c0","observation_id":"b5984fa8-f5cf-49c8-9100-8ad658725005","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Introducing our Multimodal Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:e2c699e7b30eafe314c0b3601afe040850bce782895945443d163c74c3ce8605","observation_id":"66124e9c-7c1e-4c8e-8184-b78b9e332818","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:32e68273d2b1cb31c2b6b5856d011b279ea896dc044736b6189956aae1aefd8d","observation_id":"c167a02d-2299-4490-951f-35aa07785b84","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:abeacd442ba4cb9934940ff614ed41af5976394f243ef5b15e3e4ce8655b5155","observation_id":"27057eb0-b510-40fd-b8d3-51e4e72485d8","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"NeurIPS , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d6508e0469bc43875389b25175ecd07691ef2c1f73932e27cb2180299eb19960","observation_id":"801724cf-13df-41ef-841b-d0f757cccd6d","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:5fe03051d0f05705638c16e3b62b2ca8db671237e175baa2cad2645c574b2d5b","observation_id":"64450ee3-b221-4688-a292-311c5b560e06","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9c575ad6271810578ec59b863f45e79c617e313f12e9a7d42849dba7b2484af6","observation_id":"4388b0a0-49be-44dc-ae0a-28c1a4abea87","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7383236dd87d9031b4fc62b919f14acbcebb0ced147a3f5e1ffe460f7867fcf5","observation_id":"9239d60e-0fa9-4c4e-b50c-1f42bf42a7aa","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:76154bbc1e1d5fb9856753cfa980eacbb181a07f6f59a4c362a09dac4dee21f3","observation_id":"0441c98c-1986-4e6b-8850-d531b36c02fc","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:92d326f83a01a719e7d87a7228380b1ade20777d24e69cd837df974ac4d4a7d3","observation_id":"e7e4247b-706d-4e43-acc3-fd4a67b107df","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2ab231f29dbe39201cc3117fe9de620a041c121356f00a99247685a5aeeafe50","observation_id":"530a58b2-fbd1-4a53-a02b-41c04e0df60b","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:aae2ceab33b3e4d308f675a25039055ce0859f032da79a4c1df2d0aa030be86d","observation_id":"e7ca5bb9-2b9f-4c31-a733-d023e6762809","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:b84982291175310823eed28282d2fe059f46d503998f0fc5faeb29af461f492a","observation_id":"5315ff91-0a95-4717-b660-77f17d652223","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:91c3f0a413796033e8f431b7cae9a4ebe5ee627e81dc1eb8c10e694e8c62369a","observation_id":"5cab73f5-54f6-4479-a337-b74aa487351d","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:eb2f410fa61513cb5c29230625fd3ac5584079bee935ea44b6afe66451243714","observation_id":"d0fce16b-5353-4afc-b448-d71e8ee1f721","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICCVW , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:cb3abf6d2288adda1e133a230d8e4dcc80966fbf46b6fc843bf721ef77bdd9e9","observation_id":"15d4b71b-f09c-4bdd-908d-cacf2d39cfad","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:18c9af0bdf63f2c9fc17cde115210d7e0cb65f8efa3c361dfe1ba278706e073b","observation_id":"724fe18e-0905-48cb-bbf0-bc9d3902773a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:13a3fc26a1591b19ad6cb1e362b27b64f4837c637264ad9f550213f69be7fa28","observation_id":"433671ca-26f0-4b43-a0c7-cade2ea311c8","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:b79ef0f50005df5e78802a471dd0cefb32f4f17bc5366f92b1519a291419d5f1","observation_id":"ff76c457-561f-4c2a-8936-4bd1631856bf","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:fbe542eddbca506b240e15f688b9e2f9ac8bcb1e72a1e5ad85f98981c3634028","observation_id":"3fbe5ed1-ddb9-4e7a-a85a-203e824d741a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d8124cc86ef9869868f85d170dbc676f6405be8b28a62e3c1f608073533062c8","observation_id":"5d32c7ee-b75c-4a31-ba68-46464b769f45","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:3ff775907f7219ec71f4a028d856cf39b68ce341b318de4dab7360004dfe52ed","observation_id":"f01ccc3b-ebe6-4c55-9b4a-05bd8fe6e0b1","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"EMNLP , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2baa7286de70ecb2cfb13626b913a2e23cc9de0bb23ade1d0dd7ee6b1b7f1490","observation_id":"5d26ddc4-e729-4400-aee9-2d11d48b8856","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:875f7a661ea89a80c4a9cc176052b5bcc59060b11d9006b8c8850404b790494c","observation_id":"edb82d5f-b2a6-46ca-9aa8-5b3aa49fbaaf","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:aec3de1f3855f597dc2e194733111219d647cbade99e83b6747ce6fe36ee428f","observation_id":"09ea9676-bd95-4e48-8f0d-3c389b580ff0","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"C hart QA : A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:990861c98374e6f5ecc04010c7630ebf926de612cdd13dc16e0e75cbb5a29a53","observation_id":"4838cde2-04b8-45d8-ad8f-5d8b3f615dfd","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:68ffd36dabc08e9647ac64e569d8c1ff8999135ee150afed05db74fb77b45264","observation_id":"cab89f5e-973b-48b2-b476-056988cf521a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:85ef1c77d486e9e8f1afe50f0964cc1c89187382d70391690fda6e62e15df2da","observation_id":"3b3c972e-6545-441e-b93d-89149c3406ae","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:5d7a560c206d6c8a0df7fb79652e5d7c76555acd9ab1296bc51b4808cce43309","observation_id":"696dc8e5-b942-4db2-a644-c5b22c936244","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:cc7843a2afa3352ec15683191f6a3c97adb5665a6ae16e26f39d8495b9ae3178","observation_id":"5ece66d0-fcb3-4d66-9f8d-284f3b8cba93","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Token Merging: Your","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:b2ccfed81f13bb396d325d637dfb581ba1c97163dc0c9d1c3550dbdeb2eb71f7","observation_id":"edd2530f-cd8d-4c65-a30b-d3c2360699ad","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"TMLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:c721c8d2192877038b6894ba9a072ad401f7d44b2e6879aea89907877b128afa","observation_id":"27d4cfb7-6ec3-49a7-9071-3db54f75c780","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:dc3d80a002da6a34d082a9733cbf208498bf24155a18ae9f3300431024877db3","observation_id":"57d2618c-a1ff-4ace-b9a3-ff3a77ed5e32","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:c4937e8da7bff695c50731a8cdd3484dd111a359daa083c33d3e956e0975cd0a","observation_id":"ef377057-292d-4abd-8d4f-bb2e019c4004","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7378872f5d369674f63c857d5b2aa3a699e3e73106bd6922c99774187d18d20e","observation_id":"9e4c3610-d031-46cd-b022-19c3c8597e9d","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:aab05a780a19996e306191be1242e7afde52e08062e972c2930119cfad29430b","observation_id":"0d8289c7-b895-4531-8599-c6001d5cc22a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d49743c63629771c6008008eed253f6f97d459029a029bc68675acb01b87849c","observation_id":"94abd914-4460-4ed6-86d2-8ee8344e5022","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9ca860a64b59c57873102937b263b05cdbfa748424811326e6d47802552ac354","observation_id":"479ce8d7-6947-46d7-92fb-b36bb5ef002e","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2755c694a53ae49d25f3e85d89fa118d1f6bff08e350d2a442f6f2188d355397","observation_id":"c05d7d7b-e335-44bf-bb86-045d64a736e7","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:4172b1344156e44a2b16db97cfc87670a641842b20286158f7c0e75732324236","observation_id":"8a5838f8-3b6c-4dc1-9d22-84ef355df7ae","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9e58c6fb8386ee31a741f05b4b2efcb217e75ceb33e8d1f8bd91a829dc3258bc","observation_id":"2596b9bc-7ec3-40af-876a-2643d0d3e835","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:3cbf5a041c4b13bb738be5886507880792b6eb23f635489aaa9aaacf4e2d8bc6","observation_id":"ce11db38-e1ad-49e0-8bce-aed4bbd527ba","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:fd0a36aba24806be134dec7a3bba3f1816e962f19e348495e0e509349284e8f8","observation_id":"37df9721-49b1-464e-afaa-c58da98914b7","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:717cec648424789cfb58616b2cfa998ff12ac9645b1bf7deda4e3e38c5038a69","observation_id":"e9bb46cc-02e2-441a-81ed-6f46b6d1d192","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ICLR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:4cb320a94abfed5da42557503a141be53bc9c3a4ec27d8f803581bc9238b4ece","observation_id":"5da2339a-978f-4c18-aa9d-0da08c764ae9","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:21593bb64ebff0d05690e0abb0b274ac35fb2648b279ce458a9221994adf0e7b","observation_id":"19bf2292-2471-42e7-8090-8523719e06a2","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7351726d4cb6fc6e38ddf3d98186a6174adc62a5ea4c28d647fb442aa59e4da6","observation_id":"c5af2c02-e75b-484d-818c-cc262bc5bef5","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:aa393187d1598345a136512d10647a858653acf83c9178168d6940f5d7770ab6","observation_id":"ba54c83d-6498-44be-8099-19f46e0a30a2","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:16eac86cbf83365ed6ec8c50d3bf0d3349c2ae8a02cc254a2c838c9d53d544a5","observation_id":"c1ed0df3-310d-4f08-9882-a5162e5d7aee","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:f8bee6ff15e5c039f848212f21c4e635c1584f5f70ad1d5adb0f546e7dfb3c73","observation_id":"b9e81e54-75c0-4b56-bfe2-494cbcc6b7a8","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"OCR-VQA: Visual Question Answering by Reading Text in Images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:02965abacc452641a48e1f247b8064570e35429713cfb27119e687bbec71963c","observation_id":"0849db8d-0360-4f58-aada-5ff23d3c4c32","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:2a1b28c911a07525aceb4e558a02eb402746b420e2e02f096a4876ed830b9430","observation_id":"e4eeffa6-7fba-44cb-992f-17ecbc68216a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d87f98fb9bb0509d2da5161c3dbb5b2a0439e6f918eefd688b9c2035b786f391","observation_id":"65c7b3cb-8645-43ba-9c81-80c2a48acda1","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d35d569145f383644bb824f81669f1ddfebc95b1fccf6c13cd113fdcdba8fbac","observation_id":"4c8a17c5-6ce3-4460-bc64-b5dbfbe77194","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:52862a6025fdda272d9c96b706cc597e5452cfcd6e0516c416a47bc0d0dc6a52","observation_id":"fe7b35db-98f1-4d78-9bb0-b753951e0ca5","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"2023 , journal=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:d3138934f76bf1e3e8b5db90943198c762a9e45fcac8cd6fa305efc10bd8f91c","observation_id":"8a20daad-4501-4a0d-a680-2b8e9fae1daa","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ACL , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:cdf36330464ca4d0678adbc11b9000f86820e24587054c2a896833bf311893cf","observation_id":"44b91a55-a574-4e6e-9a1f-80da576fe844","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3507.358354","doi":"10.1145/3543507.3583548","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , isbn =","venue":null,"work_id":"a70a5aa6-d08c-429b-b4a4-ca64bbdfacb0","year":2023},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:8af48f0c7c39fab09a01ae3240bb905000854a53f32d82d3dba49623c53531ae","observation_id":"ba6479a2-ce20-4fb0-8902-fb45e23cac9d","resolution":{"observed_at":"2026-07-12T04:18:28.157846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:20:35.885744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:20:35.885744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-00129-1_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":", title =","venue":"Lecture notes in computer science","work_id":"d5ac519d-012f-4f5f-b426-47662ab4b845","year":2022},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:1041e5e325406cfecc09b9b3e4eef3d6ae59397998d5860a0cd5a4b345be3459","observation_id":"b9537445-6543-40dd-baf5-1ce41312ab88","resolution":{"observed_at":"2026-07-12T04:18:28.142577Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:20:36.207199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:20:36.207199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.368140","doi":"10.1145/3664647.3681403","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , isbn =","venue":null,"work_id":"8dcc3c71-525a-479c-a8fc-9dab0a707b8e","year":2024},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:e7e8a19ac9a5c6125a18700e2e5003c0bee8c0da69173e5e001accaf66309979","observation_id":"1adbc057-ea40-4b15-af60-6388a2ff848e","resolution":{"observed_at":"2026-07-12T04:18:28.156474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:20:36.528577+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:20:36.528577+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:0616152f62fe4678f7d8805bdc845ba23ada3f66ef0436f1002b6f0c0e1b8147","observation_id":"97a94ef1-5d68-4838-b4ff-2ff816472cac","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"ECCV , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:b21799f60f8c726c1cc9914aa704027aa1056f8af2fbf9ed08ddddd7e75930e3","observation_id":"693f59b1-b044-4a71-9a44-52d6191c8f22","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:15ae30eb01c0e827bacb9acea60c19307462fffbe74a9fb196d206e00252ec0f","observation_id":"183634ce-a69f-4272-8d88-d4ed3ec542af","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:15c48535d2caa103d39b7e5a9fbaf9576255b9df76f030636ef57c09ef003329","observation_id":"562d7023-68a0-4b26-84a7-1fd7d3bacd0c","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 0 inbound Pith citation observations for arXiv:2607.03184."}