{"as_of":"2026-08-05T21:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7bf066f80c54972a760284e11b5ea0f8a5e47dec50c2fa6cfe65a9e6706f0907","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:21:09.549263Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15732/citation-record","integrity":"/paper/2607.15732/integrity","json":"/paper/2607.15732/citation-record.json","paper":"/paper/2607.15732"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.128583Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.128583Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:3cf0bf43404c065129ce08f06f7b70e565e78778c34212fbb9b028f1c5ee1bc0","observation_id":"cf8c7811-b20b-4a18-aefb-9983f8230b2a","resolution":{"observed_at":"2026-08-04T04:21:09.128583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.134022Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.134022Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4ff26387c22a95c01e3834240d9940cbee1409e775a0129a6a5ae0191b5c54f9","observation_id":"021fae71-ddaa-46a5-8872-a87940d5d232","resolution":{"observed_at":"2026-08-04T04:21:09.134022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.139070Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.139070Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7a1042ac308910b6386fcff009545113e1c73b85cd0e7b424aff1f1dd88bdce0","observation_id":"1906e085-2379-4a19-9789-fc012e45eb45","resolution":{"observed_at":"2026-08-04T04:21:09.139070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.143770Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.143770Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:d21397710ea9a08bb13735747e2244d3c17cf43dc58378c48a740821248da511","observation_id":"22c1f928-72d6-43c6-8c02-13fb14dff5f2","resolution":{"observed_at":"2026-08-04T04:21:09.143770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.148116Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.148116Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:e304f2b40e5524f41693191441de1c177ebd6100499c02935ead4cd6a0415e13","observation_id":"b4ce1faf-76f1-46a6-96cd-30ea2b7de21c","resolution":{"observed_at":"2026-08-04T04:21:09.148116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.152830Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.152830Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:f4dfe3a13b739c9c8339afe8d7fd2180226acec3a2c83a5419b035d29224b972","observation_id":"e3339789-1105-41b2-9c2d-0872a4ca17bb","resolution":{"observed_at":"2026-08-04T04:21:09.152830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.157394Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.157394Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:2a81dbf49cb7b699acb77dbbb084ccd5fb33511734cf340f27331fd9aeaadfe6","observation_id":"fca740e9-1c83-4a64-b398-fd9560fc6625","resolution":{"observed_at":"2026-08-04T04:21:09.157394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-04T04:21:09.161657Z","title":"arXiv preprint arXiv:2306.15195 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.161657Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:459075b2e360a1052d519ac9674b3bd2e5fcaddcfe9b3359af53081c818e34e8","observation_id":"f8d698ca-7da9-4329-a819-cbf95d66bdef","resolution":{"observed_at":"2026-08-04T04:21:09.161657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.166378Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.166378Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:61511a0229adf1dd5f8a8dd842e5f434a4e0b87101916d24be3c8865cde6a14c","observation_id":"68adb6fe-001d-43e1-aedf-82360d4a153f","resolution":{"observed_at":"2026-08-04T04:21:09.166378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-04T04:21:09.170735Z","title":"arXiv preprint arXiv:2306.14824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.170735Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:ebb0a9506df97308707ff191f01a7efd224a1bb655be4e94515843c480a9794f","observation_id":"2e80bcfd-7fd1-4d13-ab78-85e57d08f528","resolution":{"observed_at":"2026-08-04T04:21:09.170735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.175311Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.175311Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:eabb4a81d6e4bae3a01328df1e21e438f0d158026ab8b0558577c633a0403881","observation_id":"c487ab06-45c2-4353-b1c1-deaea963677e","resolution":{"observed_at":"2026-08-04T04:21:09.175311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.179895Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.179895Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:aa288445f629b83c6f818c1b5bf78c055c02b2fe65ecba173ff7d1ed619c7da5","observation_id":"f2b5ef75-7157-49f2-8454-4e320bc66c0e","resolution":{"observed_at":"2026-08-04T04:21:09.179895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.184617Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.184617Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:30212b351d7b97b1c58450702b604f612959d89345844d63eb2871cd364e2657","observation_id":"b0e17729-c253-4bf9-8ff7-e19d605bd61b","resolution":{"observed_at":"2026-08-04T04:21:09.184617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.189655Z","title":"3D Gaussian Splatting for Real-Time Radiance Field Rendering , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.189655Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:8faf2f19c87eec0cda5b9e83170cd5350c7bfd63b0f4cbab6f5306d876cbd0e0","observation_id":"e72e43f8-d87a-4b64-b13b-b750a9e48978","resolution":{"observed_at":"2026-08-04T04:21:09.189655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.193687Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.193687Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7b9800da04cbd3b8863d5d447643a5bd94b7a22aec9aeb2990339d423792881e","observation_id":"2dd0666c-b669-405d-ab2f-28d93e18bbf5","resolution":{"observed_at":"2026-08-04T04:21:09.193687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.197870Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.197870Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:de6d8bfabe655868dc0bee275c69292fbee4039f7abc8164d58f60a16817a25e","observation_id":"1e79bc27-74b6-41df-9894-1537190c2ed8","resolution":{"observed_at":"2026-08-04T04:21:09.197870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14249","last_updated":"2025-06-23T08:10:31Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:01:32Z","title":"CLIP-GS: CLIP-Informed Gaussian Splatting for View-Consistent 3D Indoor Semantic Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14249","snapshot_observed_at":"2026-08-04T04:21:09.201870Z","title":"arXiv preprint arXiv:2404.14249 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.201870Z"},"links":{"cited_paper":"/paper/2404.14249","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:31774b084357dc9f66997b90a81cf84ba7ccf4074e9b0a22dbc75b2df08a24a5","observation_id":"1c57e130-aa8c-45b7-93bd-c6e87cae3534","resolution":{"observed_at":"2026-08-04T04:21:09.201870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.206677Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.206677Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:ab910dbed0f1e86de54279ba67ca1c029e808ccd27c17d106bd0b92b43ca7f3b","observation_id":"0628e31f-1fcc-43a5-93b9-c08ed962b6be","resolution":{"observed_at":"2026-08-04T04:21:09.206677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.210939Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.210939Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:d3718f0bad2642e1654f64ea555b6c3cdb3557bd0272c56c49d4c97ef144dd0a","observation_id":"3a2aff54-571b-4c45-a221-9446ee15fb3f","resolution":{"observed_at":"2026-08-04T04:21:09.210939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.215534Z","title":"European Conference on Computer Vision (ECCV) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.215534Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:169304de970c380141bf96d97c5677a5d552d3a85c841289aa59276a17fe2828","observation_id":"71977250-aff3-41e8-ab6d-99010d57f793","resolution":{"observed_at":"2026-08-04T04:21:09.215534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.219631Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.219631Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:976bdef0ad20377cea7e23b9e7872d06b453d143ea6d519ac00c8ff0f8e345bb","observation_id":"aaaa50dc-6ebd-4f05-bc9a-31e35c09e636","resolution":{"observed_at":"2026-08-04T04:21:09.219631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.223809Z","title":"2024 , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.223809Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5f80958b4275e472831f55c01b3ab9e1abee37b3cbfd39eccbcfef115b6ce2ac","observation_id":"6ea8b270-946d-4f7d-9048-836a5b1f379f","resolution":{"observed_at":"2026-08-04T04:21:09.223809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-04T04:21:09.228219Z","title":"arXiv:2304.02643 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.228219Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:c705ddea0b4081c30fb07429e5ae83f81d9ddde3c1a2765168cb2a7097b60ba5","observation_id":"61f3350c-be16-4572-be72-0a45c9b38fa1","resolution":{"observed_at":"2026-08-04T04:21:09.228219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.232684Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.232684Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:908b9624a86ecd809a2fb9449b9cb0865eb6b674d9336fe31f1e1289745ab916","observation_id":"16f3417f-6d08-4b87-9d42-28380c705083","resolution":{"observed_at":"2026-08-04T04:21:09.232684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-04T04:21:09.237358Z","title":"arXiv preprint arXiv:2303.05499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.237358Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:2444c7efdd3409c805be682734dd4483c22ffa3198d06bdc4280456111ae5b4e","observation_id":"5399bad9-ea87-4a1e-b134-4d5c484a4e02","resolution":{"observed_at":"2026-08-04T04:21:09.237358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.242106Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.242106Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:df6c17da28b8e2fb6e67265d25e1d0daba0ffe67b5f5bddfab09fe76a2faf698","observation_id":"17ae87d6-6d9e-40c3-9a81-683498b8e8a2","resolution":{"observed_at":"2026-08-04T04:21:09.242106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.246255Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.246255Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:d08dbc7275abc8f4bc3347a1f4af99477184e4e7be8c3b99137ae08c1920cc7b","observation_id":"1d0aca09-6c8f-40e7-bf43-f288d48a678b","resolution":{"observed_at":"2026-08-04T04:21:09.246255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.250449Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.250449Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:380a6446c07a832af10f5d75f607dba8c0ecf38d4ed4619edf84312e99a034c8","observation_id":"38bf0ed4-fe7a-417c-971f-fefbbb3d5968","resolution":{"observed_at":"2026-08-04T04:21:09.250449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.254768Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.254768Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5308d31cbc27e367864eebb800b349cab8e1bed6cfc5ec6dd66c3ae8c28f388b","observation_id":"5c1c0e7e-f72d-4f4a-9f72-91601ea373e4","resolution":{"observed_at":"2026-08-04T04:21:09.254768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.260041Z","title":"International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.260041Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:fd1c02942c3fcbb358e21926f9958b048dc3f73fbaaa6fe222052fb60189cc9a","observation_id":"4397ef7d-a63f-4b98-a83d-4a19682c2230","resolution":{"observed_at":"2026-08-04T04:21:09.260041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.263967Z","title":"Proceedings of the Winter Conference on Applications of Computer Vision (WACV) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.263967Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:dea3647dfa36c9a10a66d188f2c155f072cbd0395e571d877a76cd46a5223993","observation_id":"a4623627-8f4b-4044-80b6-f8ba5aff142e","resolution":{"observed_at":"2026-08-04T04:21:09.263967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.267946Z","title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.267946Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:382e0076e2dc726f85c11d436ffbf9f5cd0b048ce69e4950af1679b2be3a6d29","observation_id":"169ec7f7-7054-41c3-8ef0-15e4ecc6f58b","resolution":{"observed_at":"2026-08-04T04:21:09.267946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.271833Z","title":"ECCV , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.271833Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:aaaadbbfee3bb46c58204d3f35f4e56111f488086bd1aee902554aec13469a0e","observation_id":"38df5ef1-0200-4aaf-ad3a-0d01e263eaff","resolution":{"observed_at":"2026-08-04T04:21:09.271833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.275667Z","title":"arXiv preprint arXiv:2411.19290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.275667Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7d8622cfe62fa6c9dc06ce449d46c968198aea2b2b629e6c9f10f07f609832e1","observation_id":"c8cb582a-f3a2-45eb-ada5-27097014d628","resolution":{"observed_at":"2026-08-04T04:21:09.275667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.279617Z","title":"2023 , journal=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.279617Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:026886012021d7263f62267f85046316f4a3c35cb8dd3a809b3f6b006c0e4af0","observation_id":"ebb9eb52-dead-4788-9346-4dc0aeebfbc5","resolution":{"observed_at":"2026-08-04T04:21:09.279617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.283671Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.283671Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5a6de556508a1c9088a95559f607c7498963b551d96c3156cdc41b2b4c9f6709","observation_id":"810aaabb-e5ae-4596-8d75-e18e597038eb","resolution":{"observed_at":"2026-08-04T04:21:09.283671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.287679Z","title":"European Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.287679Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:3bf9eb8b1186fb7a4b6ded868b5380ed0c59f2f3ea8cfa1f6c0e0efaea1744cc","observation_id":"6c950d29-f6c8-4ba0-99c4-a4a507eb50f3","resolution":{"observed_at":"2026-08-04T04:21:09.287679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.291790Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.291790Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:64e560791bf9fba41b477889fed1d16e8b85b056ffcd481047d8194efe455651","observation_id":"3239bce1-3f21-48c6-bb51-761f2753832f","resolution":{"observed_at":"2026-08-04T04:21:09.291790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19615","last_updated":"2024-03-28T17:32:58Z","snapshot_observed_at":"2026-08-03T13:03:45.248447Z","submitted_at":"2024-03-28T17:32:58Z","title":"SA-GS: Scale-Adaptive Gaussian Splatting for Training-Free Anti-Aliasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19615","snapshot_observed_at":"2026-08-04T04:21:09.295767Z","title":"arXiv preprint arXiv:2403.19615 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.295767Z"},"links":{"cited_paper":"/paper/2403.19615","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:de6499c96b11526afdc3c5dcf036772aa65f26e3f0aca351a28d4ba60bbe4c27","observation_id":"e644a3b2-3109-4e96-a637-8c90f4b44b58","resolution":{"observed_at":"2026-08-04T04:21:09.295767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.300082Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.300082Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:72aa9fe0510b4a0f6493f357e7ad706aa0d4082bf94efd474d21b91ce3a73c49","observation_id":"232638a0-8a21-4c10-8bee-cbc5d62f9cc7","resolution":{"observed_at":"2026-08-04T04:21:09.300082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.304117Z","title":"2025 , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.304117Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:e779886b0b26beb0acecca2aaa199e858b8a75b1906011ced10975dbdc507d76","observation_id":"04f75b32-fc4c-4936-a31b-c476e428f814","resolution":{"observed_at":"2026-08-04T04:21:09.304117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.308238Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.308238Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:410c58c295414176eebc2c5fde49611d0e838b39709e41c401279f67a88ab502","observation_id":"310ac737-3b45-4a9c-b5d2-1cb67cfecaf4","resolution":{"observed_at":"2026-08-04T04:21:09.308238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.312346Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.312346Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:483ec2bf50d7592868415bed212c6b36f1b0595d5367c5145ccc4cca3e5dfd9f","observation_id":"101eb313-7860-4023-a3fe-1a76508b6b23","resolution":{"observed_at":"2026-08-04T04:21:09.312346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.316738Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.316738Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:dc32fa2bbd1f23df7ec889244a840e343538037683e73245c0199d2f8ebc4566","observation_id":"83a92343-1ed0-481b-8d1e-7050e2cd4e53","resolution":{"observed_at":"2026-08-04T04:21:09.316738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.320703Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.320703Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:a0a0c8246789d858918ace397900d96a21c51584a63c7c078ee439de0d8d1777","observation_id":"b8b0f5e3-df44-4bb5-9923-7803e4e3212a","resolution":{"observed_at":"2026-08-04T04:21:09.320703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.325042Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.325042Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5fd8526c263b8d654cd54dd83ea327aae58c5dbed5e0219643d0f54d4814ca73","observation_id":"a99a4e65-9d05-4c04-ae59-a48defaaecbb","resolution":{"observed_at":"2026-08-04T04:21:09.325042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.329102Z","title":"and Millis, Bryan A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.329102Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:1d0fa39fab8c24ae6e21f0b6faa98a86b3e7ae7539e39609a91d8c81ddc0947e","observation_id":"59a91921-be3f-4eae-9409-9e91e23161b4","resolution":{"observed_at":"2026-08-04T04:21:09.329102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.333355Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , month =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.333355Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4aaafcb073e99bbc93bc8f0bf6ffacd0664fbab06eec3ce189dbe919be9e94a3","observation_id":"91f2dbb0-6ef5-476d-a2f9-0f8e53e7a6ee","resolution":{"observed_at":"2026-08-04T04:21:09.333355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.337559Z","title":"European Conference on Computer Vision (ECCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.337559Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:77cc11ef9d51363ce5b734c7b94da1f54011c113ee86bd93d6e78386f1dd5413","observation_id":"598e9f48-6a2c-4d7d-8e08-6e42f942ae4d","resolution":{"observed_at":"2026-08-04T04:21:09.337559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.341626Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.341626Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:3520c21cf0301dce70103924b3af27cd560bca82aa2a45c409f0539c6dcf105f","observation_id":"36148259-94d7-4c50-a45a-afafe10e214b","resolution":{"observed_at":"2026-08-04T04:21:09.341626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.345686Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.345686Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:0e7e8a54a0a2cb8e02155439f7e4e4b5f763ba30401bd52e9f5ab199b8247867","observation_id":"d75f8450-19c4-4b35-aa61-26889033b51e","resolution":{"observed_at":"2026-08-04T04:21:09.345686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.349765Z","title":"and Tancik, Matthew and Barron, Jonathan T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.349765Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:eafbb3c4e3eee3b09073981c06ea88496f58b02164d20e7b0b0427dab8b75871","observation_id":"d4dabfbc-ce9f-4da5-954c-cafa59a96b5b","resolution":{"observed_at":"2026-08-04T04:21:09.349765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.353823Z","title":"ACM Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.353823Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:b6ec73f9e7e56227063b408cc4b0ab133cedb154f928153f21b1620750a1c25f","observation_id":"e8e85611-b43b-4ffc-9def-0ffe5edbf278","resolution":{"observed_at":"2026-08-04T04:21:09.353823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.358395Z","title":"and Kowalski, Marek and Johnson, Matthew and Shotton, Jamie and Valentin, Julien , title =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.358395Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:00e2889ceaaa07a89c7b84ef6648a40f05d2016c60b262830b7d1d2c94f464cb","observation_id":"24b60b5b-d4af-4a70-8af6-2a4f9ccedbfd","resolution":{"observed_at":"2026-08-04T04:21:09.358395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.362365Z","title":"2022 , booktitle=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.362365Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5c753bac812b64656bb6fea6be0af29c9aee2d37961541a98af44fe06c1f5e2a","observation_id":"0a7003ce-4338-43be-ab5f-186106cc9852","resolution":{"observed_at":"2026-08-04T04:21:09.362365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.366153Z","title":"2025 , issn =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.366153Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:704c247d81ac5759e0b1a020138a3d4ef3c483e63e3b1b64a81205d08c069f11","observation_id":"a07722f8-0ce9-47a2-8d1c-cd69fb8e057a","resolution":{"observed_at":"2026-08-04T04:21:09.366153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.370063Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.370063Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:b8417971dcac4d8d3555a837b261980bbc3a084bb24343f132f44258f46e8888","observation_id":"c0e610a6-8226-4886-86b9-23cc9cf4a196","resolution":{"observed_at":"2026-08-04T04:21:09.370063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.373978Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.373978Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4a91fdec24adeca2dc78fba964ab0ec054f2a8ce6cd94bdcbebcb753bfacf1c5","observation_id":"d7d0b13d-f251-4996-87e9-51f7fd7c7cf7","resolution":{"observed_at":"2026-08-04T04:21:09.373978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.378293Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.378293Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:217d86c746f97ea65d6606f00e9e163f1af9494ff1674fb8bb0d8b0d188b97ba","observation_id":"22f97887-3892-4edf-a83c-745d213a4fb6","resolution":{"observed_at":"2026-08-04T04:21:09.378293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.382350Z","title":"Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.382350Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:c3c4dd216462a76a85d04a0423684aa20542c5230565aa95d63ab09388491301","observation_id":"d613ef4c-a322-4b6d-9591-33340394c0ce","resolution":{"observed_at":"2026-08-04T04:21:09.382350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.386356Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.386356Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:9df409d24e34abd623c4e151fc8b8d2f376677ded7f12c09af0bd58a8755efa7","observation_id":"f7344c48-af38-4ef0-b753-6f97951255fc","resolution":{"observed_at":"2026-08-04T04:21:09.386356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06908","last_updated":"2024-04-08T16:16:56Z","snapshot_observed_at":"2026-08-03T17:14:02.563149Z","submitted_at":"2024-03-11T17:00:27Z","title":"FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06908","snapshot_observed_at":"2026-08-04T04:21:09.390644Z","title":"arXiv preprint arXiv:2403.06908 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.390644Z"},"links":{"cited_paper":"/paper/2403.06908","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:8513a1ed18b921a8a3da461817758f8e23ab4a4968a997a9adb054593df15733","observation_id":"39519855-d6cd-49bc-a67e-107c17a7a274","resolution":{"observed_at":"2026-08-04T04:21:09.390644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.394809Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.394809Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:ee239afa71b7366a90f62322a669f3c68506d41a74cce8ccb48a42b63178cf9c","observation_id":"460d540f-3422-4307-b73b-3b955eba398c","resolution":{"observed_at":"2026-08-04T04:21:09.394809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.399106Z","title":"CVPR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.399106Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:461cbf493dc4a03ecbc3c54a47ce38918c7d598f06bcd7e999ec9117fb58f363","observation_id":"1a8c6d66-0b33-42b3-b6be-58b75b15a004","resolution":{"observed_at":"2026-08-04T04:21:09.399106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.403186Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.403186Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:6c2f6eeea66697ad79a341b41c1a64b86cb11e1b665ccffc75c29b3cee7f64db","observation_id":"2b939cf1-ccaa-4cdc-83b0-9002a0839d25","resolution":{"observed_at":"2026-08-04T04:21:09.403186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17898","last_updated":"2024-10-17T07:11:31Z","snapshot_observed_at":"2026-08-03T23:05:42.089043Z","submitted_at":"2024-03-26T17:39:36Z","title":"Octree-GS: Towards Consistent Real-time Rendering with LOD-Structured 3D Gaussians","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17898","snapshot_observed_at":"2026-08-04T04:21:09.407479Z","title":"arXiv preprint arXiv:2403.17898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.407479Z"},"links":{"cited_paper":"/paper/2403.17898","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:ee1fd97a4e60747fc70723b39a77eac1e7f3a04694e8763fb581a27e233dc375","observation_id":"21143cfc-7d94-4649-9759-afb85fbc3369","resolution":{"observed_at":"2026-08-04T04:21:09.407479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.411670Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.411670Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4719237f505cf9dd4eb08ca3a5a0601536fa50984808116a0d190e9c555c59bc","observation_id":"9253987f-0361-4ab0-b41e-393466c6320b","resolution":{"observed_at":"2026-08-04T04:21:09.411670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.415559Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.415559Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7c0012c9d6bf6cf97b12587d6e1a6284442caf5baab825987c393395dfc60a90","observation_id":"d0228db1-c616-41de-8004-32048b3a40d6","resolution":{"observed_at":"2026-08-04T04:21:09.415559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.419783Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.419783Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:d08102d0bca3d01da227942021f7860d543cfd5239ac7c6f98da9d7031cb0b5c","observation_id":"e10e0f40-1b89-4e16-82b3-36aec294e6ab","resolution":{"observed_at":"2026-08-04T04:21:09.419783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.424353Z","title":"doi:10.21105/joss.00205 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.424353Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:15f6d0e9e0f6961eae8189ad12e42aa88d871936f32dd6d5386b9ad5023a0b99","observation_id":"3c3853c6-b785-48ea-baa9-03c7c5173615","resolution":{"observed_at":"2026-08-04T04:21:09.424353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.428707Z","title":"Xu and Jun-Mei Song and Mingchuan Zhang and Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.428707Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4c0f042cb0a12673b68f27bec69acf3047de82d118af48f513d52f75515be7a6","observation_id":"2c2953ae-690a-4a5a-9e49-ab17052aa646","resolution":{"observed_at":"2026-08-04T04:21:09.428707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.432697Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.432697Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:913d3d79337e6f423213fc8aa7a8b4c278ccd557c2a4cd6a9118d250931a2053","observation_id":"f77dc814-52ca-4ae7-9a09-edf22f0ab71b","resolution":{"observed_at":"2026-08-04T04:21:09.432697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.436762Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.436762Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7d07b707bae9671f745637ceaae244abd501dbf3925ba916c1f1297648124bf8","observation_id":"2b179db0-6ec6-49c3-90ba-6a6c03344b44","resolution":{"observed_at":"2026-08-04T04:21:09.436762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.440871Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.440871Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5230cd463ca8e7ce34810d4f39b801aafabcc6fa68b9e8eebbc0968f2b46e902","observation_id":"1374945e-90aa-4fdb-ae32-f462b26e878d","resolution":{"observed_at":"2026-08-04T04:21:09.440871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.445287Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.445287Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:f7c30f1aa10d15f7b80510852900457b01115f526fbeef28e923307bb3559dda","observation_id":"ea639714-3c7b-473b-939f-c140f12a025d","resolution":{"observed_at":"2026-08-04T04:21:09.445287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-07-06T21:41:14.693158Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-04T04:21:09.449182Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.449182Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:b57488baf8b7bab8a92dd2e82ae2c9715efe2e787db95f477245d54bf922eee5","observation_id":"ab72c83f-49fb-468a-906a-74a8aca1be14","resolution":{"observed_at":"2026-08-04T04:21:09.449182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.453709Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.453709Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:2f347aa260b9941e86ecb3fb7d311e3629182d9f1f5029c9f8f65a3e67e09937","observation_id":"f2f7b937-6de7-4fc4-a6a5-12f127173186","resolution":{"observed_at":"2026-08-04T04:21:09.453709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19930","last_updated":"2025-08-27T15:21:58Z","snapshot_observed_at":"2026-08-03T23:42:29.864142Z","submitted_at":"2024-11-29T18:42:28Z","title":"On Domain-Adaptive Post-Training for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19930","snapshot_observed_at":"2026-08-04T04:21:09.457800Z","title":"arXiv preprint arXiv:2411.19930 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.457800Z"},"links":{"cited_paper":"/paper/2411.19930","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:8a393456729cb5407fb42613e3ef8fc1b453dd3dea50836f24d8b84f5df7f564","observation_id":"e0774910-eafa-485e-be47-68b692f54a18","resolution":{"observed_at":"2026-08-04T04:21:09.457800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T04:21:09.462247Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.462247Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:2add4e025ccb6e41a6cbeb755b696ddde02a2ff2fd09a04f490d13ad72fa17f1","observation_id":"7d05d336-5f99-45c3-aec8-3a8579d62d2d","resolution":{"observed_at":"2026-08-04T04:21:09.462247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-04T04:21:09.466897Z","title":"arXiv preprint arXiv:2411.10442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.466897Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5de7605b65edf9f725e1f3282ecf5af6b8f54eb17fb6e4902256f504ec7a9bce","observation_id":"73214949-aefa-443c-9ec7-aa2a344116c0","resolution":{"observed_at":"2026-08-04T04:21:09.466897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-04T04:21:09.471316Z","title":"arXiv preprint arXiv:2404.16821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.471316Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:0f9d0974b1347f9ee91e87e23b7cb8bce27c200a0c6e0602005f18aaef79c9d9","observation_id":"1933ea7d-c7d3-4c84-838a-c3a0190287ee","resolution":{"observed_at":"2026-08-04T04:21:09.471316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.475607Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.475607Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:9960f4ba34864463ae36b35a424c5a2bf328d4a95a237abeb895e5edf7839f7d","observation_id":"ac07ac60-1b10-4c97-af92-eb108b3d754b","resolution":{"observed_at":"2026-08-04T04:21:09.475607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.479564Z","title":"Dynamic-","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.479564Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:160f518de7711d369e04729a3bbcb1211b703aeec2df2a2d758630cfb828ea5f","observation_id":"4ffb9eb8-f84c-4921-9aad-0b4895c64245","resolution":{"observed_at":"2026-08-04T04:21:09.479564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.483510Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.483510Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:a8f4a6ea17671caade38f94501a0048404044c107774824cc1bedf6002d3e2f0","observation_id":"5c58886a-167e-451a-b4d4-4b3bb8800955","resolution":{"observed_at":"2026-08-04T04:21:09.483510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T04:21:09.487554Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.487554Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:f743d927a0c6eb034c7a2c3efbb6397b5037a01331c544f2700af71a33280bdd","observation_id":"4ac2b44f-7147-46b2-ace2-66a20155e044","resolution":{"observed_at":"2026-08-04T04:21:09.487554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T04:21:09.491880Z","title":"arXiv preprint arXiv:2502.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.491880Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:31e7fe43a435af2ad95055a7e16b5231faad0fb49315858ba839cdd45ccb702e","observation_id":"b90d7d0d-b377-4d47-aa6e-c7e0497e4183","resolution":{"observed_at":"2026-08-04T04:21:09.491880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.496400Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.496400Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:0236cc5b6d9cfe0791159444999504fd2e8d31a626fce5abea0f85dce25d663c","observation_id":"468dae09-e600-42f4-a6d2-e0f8ef9de951","resolution":{"observed_at":"2026-08-04T04:21:09.496400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T04:21:09.500417Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.500417Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:a55b7ff1bc0daeab1acf95402f85d5e024670f0152a1701b462b74f3f9b6f8bc","observation_id":"64255359-b506-437b-887c-6c493f2432fa","resolution":{"observed_at":"2026-08-04T04:21:09.500417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.20633","snapshot_observed_at":"2026-08-04T04:21:09.504507Z","title":"8 model card: Towards generalized real-world agency , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.504507Z"},"links":{"cited_paper":"/paper/2603.20633","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:b92337b09cbe377a96bdfe980fe7ce5ffda6a2ceb86016d43dd6ceff8a82aad9","observation_id":"13842b0e-7030-4411-9814-3537296bc6d5","resolution":{"observed_at":"2026-08-04T04:21:09.504507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00248","snapshot_observed_at":"2026-08-04T04:21:09.509012Z","title":"0 model card: Towards intelligence frontier for real-world complexity , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.509012Z"},"links":{"cited_paper":"/paper/2607.00248","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4f8e03d8a62d75a9e27c645d85e513e5c46fe11ff35b8a3e9128dab50fcd5ede","observation_id":"f751eb30-825c-42a3-9b55-f8f6b3447ed1","resolution":{"observed_at":"2026-08-04T04:21:09.509012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.513123Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.513123Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:e31f7a29294ccda235b4605bed69ed1ea68340f2f2d8d73ebe0a9ee662826121","observation_id":"91efcd0c-0a4e-4571-8d32-0103d1ec7264","resolution":{"observed_at":"2026-08-04T04:21:09.513123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.517120Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.517120Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:4ea4f84cce5a5966c0cd88a840b93c7da397d744e6e0d4fe21daea2e381c506e","observation_id":"ddc991b8-49f7-4b19-b97d-424799c7d0f5","resolution":{"observed_at":"2026-08-04T04:21:09.517120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.521168Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.521168Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:62404815ae2607a45b4d93b635b4ec72f8e3e4b6584d78eb5f5d07c14587debf","observation_id":"52f5e2ae-a81f-479e-93c4-d90d021ae409","resolution":{"observed_at":"2026-08-04T04:21:09.521168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.525346Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.525346Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:5a46c584cba7e7bc5b8989366c5c9b3674f7cc03b0390b817c6338414df46566","observation_id":"49c6366b-99d2-4b86-8190-bccf6221b554","resolution":{"observed_at":"2026-08-04T04:21:09.525346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.529341Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.529341Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:13c7644769064d67233efb102605d36613524fb770f0d4cc42729be96cc53661","observation_id":"36756bac-5506-406a-b447-abc7abcb4903","resolution":{"observed_at":"2026-08-04T04:21:09.529341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.533188Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.533188Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:1ac875536f4a2d74c9181a7f6f61e3005730f6aae8366ebd196f761c6f9c66bd","observation_id":"8d2ab822-6b8c-417a-b2a1-5b26b3893b3e","resolution":{"observed_at":"2026-08-04T04:21:09.533188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.537238Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.537238Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:d22813b483a6f192aaa89e8afa329af97105a9fc78cdcaf9ebf619f0d452bea8","observation_id":"19e597ed-9394-410c-b3e0-75b378d3000c","resolution":{"observed_at":"2026-08-04T04:21:09.537238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.541384Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.541384Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:9277ba5c6fbf1686806812bda1890aec58bc2da9984899edb033567470308f24","observation_id":"db679036-e495-4009-9818-f2e58bed3b84","resolution":{"observed_at":"2026-08-04T04:21:09.541384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.545388Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.545388Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:982dc5065aad753a62114ca754f22939e3df7e550752356605913a129250fce1","observation_id":"94c685ac-cd6b-4d64-a285-7eb70a8f21b4","resolution":{"observed_at":"2026-08-04T04:21:09.545388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:21:09.549263Z","title":"and Murphy, Kevin , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.549263Z"},"links":{"citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:7c5e24b28b35ab215af41f47761f60dc37f49109b228f400acc187cb4bda4661","observation_id":"6d90ae90-cf84-4cb1-896a-63657b9aa047","resolution":{"observed_at":"2026-08-04T04:21:09.549263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T20:52:10.802950Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 0 inbound Pith citation observations for arXiv:2607.15732."}