{"as_of":"2026-08-23T20:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e00bf10cd3eaa0da2449d03c5c08ad23b0587cccc9fbd9a48dd68b18acfab6c4","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:30:35.361785Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04833/citation-record","integrity":"/paper/2509.04833/integrity","json":"/paper/2509.04833/citation-record.json","paper":"/paper/2509.04833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.913648Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv, 1 (2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.913648Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:c17597de7d3b69a83432e47f5c0e061d2d39105142119f7970eef30cd21ee61e","observation_id":"765229e9-51ec-4c6d-b8ae-bd2c9b503962","resolution":{"observed_at":"2026-08-15T16:30:34.913648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.919228Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.919228Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2e92b57017fa6a8416da88e5005309fd3d901e653da969316b7deabdb0838a61","observation_id":"5b1333c4-4e84-4484-81ec-a2e20de91120","resolution":{"observed_at":"2026-08-15T16:30:34.919228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.924724Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.924724Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:57250b05ce613dc14e7ee282db32722e47e775258cf8c74ec1200b7973dcc2a4","observation_id":"b6c361a7-e809-4865-916f-d958f137ff60","resolution":{"observed_at":"2026-08-15T16:30:34.924724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.931379Z","title":"Ref-nms: Breaking proposal bottlenecks in two-stage referring expression grounding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.931379Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e9843a1a419e6547e14d2074dfe775cdce17831c1c51f6f88bfe5e92d8ba4024","observation_id":"adcc4ed3-bc77-422b-95c4-82c1df66f4e1","resolution":{"observed_at":"2026-08-15T16:30:34.931379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.936619Z","title":"An efficient and effective transformer decoder-based framework for multi-task visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.936619Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2f455c099ade97e7424b8d5afec328c0d6b7bc1da8a6c8009217dc9f19aa322a","observation_id":"da0f035f-081b-4310-b3b4-c9f814b6aee6","resolution":{"observed_at":"2026-08-15T16:30:34.936619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.942326Z","title":"Sam4mllm: Enhance multi- modal large language model for referring expression seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.942326Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:81ce83d2a728cf1799759172a559e92441af1e1f7904034c1d458aaf526bc896","observation_id":"34c5bbfc-ff38-4bec-9bf5-3e97ad4d0094","resolution":{"observed_at":"2026-08-15T16:30:34.942326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.948052Z","title":"Parallel vertex diffusion for unified visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.948052Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:3203de75153265de1b26ca2ec0c5cca5dddc4baaea6dde10cd8d1406b1b51596","observation_id":"dc3f05ff-7616-4224-a639-5fa0b0d07323","resolution":{"observed_at":"2026-08-15T16:30:34.948052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.753750Z","title":"Mask grounding for referring image seg- mentation","venue":null,"work_id":"81ddcdc1-1e03-4c5d-b267-7adaa360f40b","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.953226Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:669055f59897f5ab13140e91edd57f6b08afad2fcce3ba7df0f9fa4f2edd48b5","observation_id":"f709f40d-8c1d-4978-8adb-ea7a99cb3b78","resolution":{"observed_at":"2026-08-15T16:30:36.759092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:34.958852Z","title":"Simvg: A simple framework for visual grounding with decoupled multi-modal fusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.958852Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0ea772e40f35db764e4844eb2b590a8c9081c2fe84a1359aaebe0167c8134f8f","observation_id":"364a295b-e8a4-489f-8455-0927806a9e0e","resolution":{"observed_at":"2026-08-15T16:30:34.958852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.725365Z","title":"Deris: De- coupling perception and cognition for enhanced referring im- age segmentation through loopback synergy.ICCV, 2025","venue":null,"work_id":"c3ed53d7-2316-441b-a6f0-e198b38cef8a","year":2025},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.963928Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:14aea78ab478859114628640fc6ba46341ebd2de2cb0267609afd4805ac67710","observation_id":"cb26641c-eee3-4e65-9e94-4141070bed72","resolution":{"observed_at":"2026-08-15T16:30:36.731285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.709217Z","title":"Multi-task visual grounding with coarse- to-fine consistency constraints","venue":null,"work_id":"d2f573a1-713f-45df-aa35-daf0e266a7bc","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.969480Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0b3ea2503837a1c3e346289028f56af1caf288c5329e043a9914047e0984cf79","observation_id":"649f2a40-bbb0-4113-8508-c72bd8727245","resolution":{"observed_at":"2026-08-15T16:30:36.714323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.692441Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":"fc8bf943-38cb-47fc-81c4-6003101795b2","year":2021},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.974699Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e201fab573b40dfa7a342d68a660a3919b2a6c088c66787deb680a5af4806409","observation_id":"90f590c0-ec82-4c7e-825b-c476c97e5767","resolution":{"observed_at":"2026-08-15T16:30:36.697483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.675030Z","title":"Transvg++: End-to-end visual grounding with lan- guage conditioned vision transformer.TPAMI, 2023","venue":null,"work_id":"acf5cb9e-4793-4540-bd50-4f2a9a21960b","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.980115Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:fdff89dbd14a78ff914ae113fa274b3f6e2943769fb10de0fa3bb81244f6d9ea","observation_id":"d7650124-3954-4132-8d5e-306bcd43b77c","resolution":{"observed_at":"2026-08-15T16:30:36.680382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.658151Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":"43c310d1-4f5a-41ce-8894-95de86d760b0","year":2021},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.984999Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:9e0d808f31eae882b308000950925ff613f8f11f9e75f8cd80e39802514d70c5","observation_id":"2b3363f5-146e-46c5-8960-c05949fa9b1e","resolution":{"observed_at":"2026-08-15T16:30:36.663659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.641573Z","title":"En- coder fusion network with co-attention embedding for refer- ring image segmentation","venue":null,"work_id":"0b1bcc91-6b63-4341-93d4-8e1b4486194a","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.989692Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:da9b12399b9597f10629a35aa0a809caa01f6965a77389ea5f266c3f881c40a4","observation_id":"6fe7b854-d9c9-4e88-be9d-61e0abd7db4f","resolution":{"observed_at":"2026-08-15T16:30:36.646875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.625129Z","title":"Mask r-cnn","venue":null,"work_id":"e27dd812-41e4-4717-a284-8226458f6b29","year":2017},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.994512Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:b13ffa2d078d9a840f6636aa43f95df1c382438db1a9f1c30dbe3716fb9b3dc3","observation_id":"96f86004-9e27-4a98-998e-c59243da7a63","resolution":{"observed_at":"2026-08-15T16:30:36.629978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.608896Z","title":"GREC: Generalized referring expression comprehension","venue":null,"work_id":"eed83e69-9218-409c-8a4f-2bcb298abf62","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:34.999801Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:69416b51bed23a77dbdc2399ac83abf93abc7ce1b210f71154d60b950a97ae59","observation_id":"d68347c4-d6d1-4e73-a07f-0e4ab0e5bb9a","resolution":{"observed_at":"2026-08-15T16:30:36.614403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.004958Z","title":"Learning to compose and reason with lan- guage tree structures for visual grounding.IEEE TPAMI,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.004958Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:6c78c982b859e313426dcb4ca16daadf3637e765a287b33005f8fcc1d7226d5b","observation_id":"134483bc-420b-4c0b-8a28-e73b5e42837a","resolution":{"observed_at":"2026-08-15T16:30:35.004958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.582409Z","title":"Seg- mentation from natural language expressions","venue":null,"work_id":"54d48b44-f4eb-4462-a55a-f06c037a522d","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.011137Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:31bc3770c22f01a587a0fde59eb9c97bd2e78eebb93235e4426be15c8e326a02","observation_id":"2c93d68f-8385-411b-9d7e-65663fc4d444","resolution":{"observed_at":"2026-08-15T16:30:36.587391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.565868Z","title":"Natural language object retrieval","venue":null,"work_id":"19fdc3d5-8578-43f2-87b3-17ec51925d4c","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.016131Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2c21fd43a7384e9662d3b88d0ff9f46ef123132f188e78f93e6c715a0cf3c4ac","observation_id":"6e1debb1-c172-4ae2-91aa-ce9b9d19c3d0","resolution":{"observed_at":"2026-08-15T16:30:36.571108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.549664Z","title":"Modeling relationships in refer- ential expressions with compositional modular networks","venue":null,"work_id":"7ed377f1-6a8e-4d97-8039-8b2b970484fc","year":2017},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.022036Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:b09a69af246ab5572224bd91e442c808bef4ebe5fd9e940deea52311ac025cf6","observation_id":"b10e7153-7c18-44e9-9049-a1d7da179e70","resolution":{"observed_at":"2026-08-15T16:30:36.554653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.532817Z","title":"Beyond one-to-one: Re- thinking the referring image segmentation","venue":null,"work_id":"cf419f0b-4963-41b9-85c3-988afb4ff19e","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.028078Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:8b8be46c11c2297e9faf5d11c87b7a0ab2fd958c3a25d21f4ea218bdf8deaba4","observation_id":"ad3c0b03-f102-45ad-a059-e8addd1b4471","resolution":{"observed_at":"2026-08-15T16:30:36.538519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.515510Z","title":"Densely connected parameter- efficient tuning for referring image segmentation.AAAI,","venue":null,"work_id":"f045e096-aa50-4d1f-bba0-99682473f0b8","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.033843Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0d2c5f2cc3d3b8f18cf41861ddbcf0b91d52360217ac3c1d0fe99afdb647e4d3","observation_id":"7250de98-a3cc-41c3-8882-aa6b2d35e113","resolution":{"observed_at":"2026-08-15T16:30:36.520959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.497939Z","title":"Referring im- age segmentation via cross-modal progressive comprehen- sion","venue":null,"work_id":"9f492235-dab4-40b1-bbb8-c445d84272fb","year":2020},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.039292Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:842592a8d65c7975ae50f1494d3e3d56a2494436816d6eaca4a5fb5cddf4a9ad","observation_id":"ce62fc49-8421-46e6-aec3-b3131b7ccaa9","resolution":{"observed_at":"2026-08-15T16:30:36.502995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.481736Z","title":"Mdetr- modulated detection for end-to-end multi-modal understand- ing","venue":null,"work_id":"d74b4046-e72a-4d3f-902d-8f73b96e1163","year":2021},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.044178Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:3e6e4adfac79385f182578470e185cb2351ea6c07e08c41a464224e383d5b4ca","observation_id":"30d73a67-d4ca-4fa9-8a36-614b1ba5a24b","resolution":{"observed_at":"2026-08-15T16:30:36.487048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.465766Z","title":"Segvg: Transferring object bounding box to segmentation for visual grounding","venue":null,"work_id":"ab8fdb66-a760-466f-9f1b-72c14db819e2","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.049337Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:409be47ddcdcfd234e28621e2cc9a812562d27ab865c63a983a349a089f7040d","observation_id":"ebe22ec4-b737-4e47-beb5-c01dd628759a","resolution":{"observed_at":"2026-08-15T16:30:36.470972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.449536Z","title":"Restr: Convolution-free referring image segmentation using transformers","venue":null,"work_id":"e778e1a7-dec1-4516-9979-a901d2445438","year":2022},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.055190Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:08a4febb2f3a19d97b19ee232bbd524d10caf8ee07f8cd019fae599cbe320cb6","observation_id":"32edafaa-a7e1-4f8b-9468-8cb196493698","resolution":{"observed_at":"2026-08-15T16:30:36.454881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.433139Z","title":"Segment any- thing","venue":null,"work_id":"5815addd-c1d0-45ff-99ec-a1c778d0f824","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.067703Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0567697b46d4b391d28841b3726469c07e7f6d0afc32f6a3762f1ace6c75086b","observation_id":"3d5a1919-8a79-4211-b698-1259fafb1328","resolution":{"observed_at":"2026-08-15T16:30:36.438074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.072843Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.072843Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:be2c2a7816b5343831595ed5ccf33e4b9376c4b9cd664a2ed09ea666cc029563","observation_id":"dec76a0f-d129-417c-b6bf-3881e0b54bbf","resolution":{"observed_at":"2026-08-15T16:30:35.072843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-21T11:41:36.691024Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-15T16:30:35.077904Z","title":"A survey on benchmarks of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.077904Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:4d39a68fc8f81fae3a0afa155bf56bdf71b6731566650770072791e64f970b97","observation_id":"cbf0d661-ab40-43d8-97cc-d74993ddc0e8","resolution":{"observed_at":"2026-08-15T16:30:35.077904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.406191Z","title":"Grounded language-image pre-training","venue":null,"work_id":"47778fac-d725-4210-b61c-1b165d3faddb","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.083881Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2d341bb66f1384482b469439d25e7f8a2760e014fd261cdf68bf1ebfc9ece627","observation_id":"0f5dec88-7522-479f-96d3-f4f4fa5a2510","resolution":{"observed_at":"2026-08-15T16:30:36.411211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.389892Z","title":"Referring transformer: A one- step approach to multi-task visual grounding.NeurIPS, 34,","venue":null,"work_id":"f6b62dd2-774d-4810-b359-fab2a626cf4f","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.088975Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:b41c6eebf1f8d12616892cdaa180420ce47334cbb55486b0f200533f4764f6f7","observation_id":"865d57be-32ae-4aaf-ae28-ba14c8be83be","resolution":{"observed_at":"2026-08-15T16:30:36.395214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.373320Z","title":"Bring adaptive binding prototypes to generalized referring expres- sion segmentation.arXiv, 2024","venue":null,"work_id":"cf75d3a3-d001-4412-8d8d-fd146d73842a","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.093877Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:6dc9fdcec9be63aacf2e06f87a10faa9ea89282a9765d68c1d58a09161237f8d","observation_id":"0f692e05-dad9-4140-a94f-6593473bd908","resolution":{"observed_at":"2026-08-15T16:30:36.379145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.355074Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"f40fe710-06c9-4270-a7d5-5c57366e8105","year":2022},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.098740Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2cbaee3b0245b658ff88ab1ef828bbe9c0cdf287071ca0e7ffdee4b9d8000a69","observation_id":"361aacd1-8b4f-4147-8c32-0b0c2f3bba59","resolution":{"observed_at":"2026-08-15T16:30:36.361264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.336772Z","title":"Ground- inggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"fddeb866-c544-4805-9ec5-66dcf94ba8d8","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.104592Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:8c9eae49a5b79732c9de2d6b1c2fa3ef1ce02c6278131cab4e99b33ba91eaea0","observation_id":"30bd41d5-1578-43e0-8116-9dae4abb464b","resolution":{"observed_at":"2026-08-15T16:30:36.342064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.320724Z","title":null,"venue":null,"work_id":"14a94ee9-9b4d-4599-9521-7003ce45753d","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.109564Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:4459620baed05b7f378285f65d7523193738d24d4bf29a8ddb5c5bdf161959b2","observation_id":"4a9e49fc-6dda-4417-9dd7-d78bae9f9621","resolution":{"observed_at":"2026-08-15T16:30:36.325636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.302853Z","title":"GRES: gen- eralized referring expression segmentation","venue":null,"work_id":"d594a690-a1d6-4829-a743-3f0ba3b1818a","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.114561Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:210daa2be98ab703fa73837f5f3e181fafdec261e22455e529b54580a37af87f","observation_id":"fe9027ca-1e02-45b8-a7f3-e6866ac8260d","resolution":{"observed_at":"2026-08-15T16:30:36.309021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.286647Z","title":"Multi-modal mutual attention and iterative interaction for re- ferring image segmentation.TPAMI, 32:3054–3065, 2023","venue":null,"work_id":"fb4f5959-cc82-470d-82e6-f5d7cf386cbf","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.120016Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0ec53811e4e5c808116c7fd4664964b292663ce24c8d42c6e600f0baa0aa30c2","observation_id":"c02f88b6-1f52-4080-8c35-8035e2d3403a","resolution":{"observed_at":"2026-08-15T16:30:36.291837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.270193Z","title":"Learning to assemble neural module tree networks for visual grounding","venue":null,"work_id":"b03bbde7-a39e-4ad6-9ecf-2c89d17754cc","year":2019},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.125087Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a3d97c2828fa1cb766bc627fe7c854e1d6748ea820fdc3ea4a906df6cf465cd7","observation_id":"80fef60b-bea0-4108-a359-da8f27db7200","resolution":{"observed_at":"2026-08-15T16:30:36.275374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.130130Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.130130Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e50af9960aa5ea7d475ae4b1bf31b1988bce6a12b41883713e3dba86d272663b","observation_id":"9c17dbfd-224e-4bff-b66e-b0619bbc25dd","resolution":{"observed_at":"2026-08-15T16:30:35.130130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.242388Z","title":"Poly- former: Referring image segmentation as sequential polygon generation","venue":null,"work_id":"6c7d65ee-b0ce-426c-94a2-a3bf3cc9f607","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.135981Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:6c2af147ae7443466806a6124ec7f5fa44616b4e905e6afebfccd9df5cf84f48","observation_id":"ee286886-bd7e-4acf-b76b-c3831fb03afd","resolution":{"observed_at":"2026-08-15T16:30:36.247388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.226087Z","title":"Dq-detr: Dual query detection transformer for phrase extraction and grounding","venue":null,"work_id":"4e427ad6-8cd2-49f6-966b-c75179721390","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.140776Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:6fd92a96653d483575699401127a674bf13e9c946d3089391662260dc1b20de9","observation_id":"e1bedebc-0bf8-4d6b-ad2c-5e6f85baf1cf","resolution":{"observed_at":"2026-08-15T16:30:36.231330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.209765Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv, 2023","venue":null,"work_id":"afbe5d0d-c719-4a3a-92b0-e40eba50b186","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.145436Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:b73b3c91295a57451d75876736ea165117229cc41ee0f262181a03a3f2f60a29","observation_id":"e2299073-1046-416a-b21d-6952d82a1dce","resolution":{"observed_at":"2026-08-15T16:30:36.214540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.193589Z","title":"CARIS: context-aware re- ferring image segmentation","venue":null,"work_id":"0896d309-73d8-48d1-8776-9e34299f2d07","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.150568Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:fd8b6243757f302ad98f9b552e8b7c96d67cdd52ac01cd70964b5826e6e107bc","observation_id":"ae9c7165-eeaa-4975-b38e-3fa755808fea","resolution":{"observed_at":"2026-08-15T16:30:36.198737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.177047Z","title":"Dara: Domain-and relation-aware adapters make parameter- efficient tuning for visual grounding","venue":null,"work_id":"09277447-be4e-4e6e-b88d-dde7069b6749","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.155698Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e5083d07a8bdf4e4e8313c41d83b67f7cc8fb13c451ea08c517b895eaf2ee20b","observation_id":"144e30ea-94b4-4726-aad6-eec1fe209284","resolution":{"observed_at":"2026-08-15T16:30:36.181964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.161327Z","title":"Mapper: Multimodal prior-guided param- eter efficient tuning for referring expression comprehension","venue":null,"work_id":"2f4fcfae-6f8c-4dbd-a2e3-5cdf29069ac5","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.160526Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:653b2ef9741c249fdcea87cf5654b8b0b3ce64dda8af63576d7cb75811719b3b","observation_id":"7248157d-b4d2-4ef1-8578-983a0b618103","resolution":{"observed_at":"2026-08-15T16:30:36.166058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.145708Z","title":"Improving referring expression grounding with cross-modal attention-guided erasing","venue":null,"work_id":"97cc8495-c501-4d23-a6e7-136a015a958f","year":1950},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.166059Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0768d7de1058951763b8ad84e5789e500573735da301fc73248995647b452bdd","observation_id":"732cb52f-7317-476f-8bf4-d86d80738868","resolution":{"observed_at":"2026-08-15T16:30:36.150362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.129679Z","title":"Improving referring expression grounding with cross-modal attention-guided erasing","venue":null,"work_id":"797e2a69-18d1-4609-9d23-dfc386773afc","year":1950},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.171179Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:7ab08f6c0a2b55dc89caf3ace793ee1006d0eac69527e02aef00a351be8f5c09","observation_id":"a3644e9a-66ce-454b-a448-31476398d77a","resolution":{"observed_at":"2026-08-15T16:30:36.134863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.114063Z","title":"Multi-task collaborative network for joint referring expression comprehension and segmentation","venue":null,"work_id":"adcf5022-adb7-4135-b1e6-d73166c9d2c0","year":2020},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.176132Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:0e0727740f4d4cf47455716cbd8eb0bfd0731b57259c2cb229dcad3f84c7340c","observation_id":"903331b6-e3fb-4acf-a3ba-8d39a8d25247","resolution":{"observed_at":"2026-08-15T16:30:36.118887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.097743Z","title":"Hdc: Hierarchical semantic decoding with counting assistance for generalized referring expression segmentation.arXiv, 2024","venue":null,"work_id":"63e4eb1f-b48a-432b-bbe5-03ee68a2f636","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.181176Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2d38c3959b0abc4ef4464ed5955ac74c703f048b56a3764ceaca197ca05580fc","observation_id":"666517f0-1600-4300-a6e3-b6a8d37787b2","resolution":{"observed_at":"2026-08-15T16:30:36.102962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.080716Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"4370a135-4c56-48fc-8bb7-a08d336771b5","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.186068Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:786199d8224f5f54506d4b1692e2938227b244031c3417c50f1bafad36e637fb","observation_id":"fc41aa72-5228-4b98-980c-68e0ece38947","resolution":{"observed_at":"2026-08-15T16:30:36.085925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.064944Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":"edc2b731-0d2c-412d-8fbf-2af71f7edade","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.192007Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:308ed0598b25a56ac1ae2467fda53efa577a589b925ac1ecbe48f851f9c021e7","observation_id":"fdfd0865-ecc1-4f62-af00-5e3746739e69","resolution":{"observed_at":"2026-08-15T16:30:36.069994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.047216Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv, 2023","venue":null,"work_id":"048f2e5c-a234-4c1a-b5a4-481af26a863e","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.196910Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:4de0c57803a31e5ee0b66fb2f49bdcb49c36e90756ec28ee0081224301808e3e","observation_id":"37b95990-9226-4b39-a79d-8d70e842fedf","resolution":{"observed_at":"2026-08-15T16:30:36.052942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.031241Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":"cd9b5cf6-91e3-4ffd-9cbd-4a09ded5cca0","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.201601Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2be3df701106b6dc00f481282a2565884579f63957c158c78becb332d3c0d763","observation_id":"da0cc831-8f2a-42be-9e9d-86939ac3d49d","resolution":{"observed_at":"2026-08-15T16:30:36.036560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:36.014004Z","title":"Yolov3: An incremental improvement.arXiv, 2018","venue":null,"work_id":"33bf7db0-d498-410a-a8c5-fb62b64a2353","year":2018},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.206218Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2bb3b49e452985e64e4c6a517f58af5c6ee7fd4fe1cc6954a7f421b6bc77e326","observation_id":"8fdda0d5-87e4-4ebd-a963-2387eab9fc62","resolution":{"observed_at":"2026-08-15T16:30:36.019077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.997951Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.TPAMI, 39(6):1137–1149, 2016","venue":null,"work_id":"618617f6-da4b-4289-9fa1-8f52af8ba96b","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.211792Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a18f304d7dde6a13e5fc00719feeb0aa0f494e5e1fd5f10dac5b9bec046d5c75","observation_id":"f3a9473f-6cb4-445d-b924-382f092628c4","resolution":{"observed_at":"2026-08-15T16:30:36.002864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.980079Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"803bfe87-86e6-4bdb-9c2d-4ace7cc0edc4","year":2015},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.216680Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e05c33fa01e3364320fc7f63b4caa456862da9757bac78faa089305cfd4f9d22","observation_id":"7550a75c-f2d8-4416-9123-ead8de55bd27","resolution":{"observed_at":"2026-08-15T16:30:35.985815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.962367Z","title":"Lqm- former: Language-aware query mask transformer for refer- ring image segmentation","venue":null,"work_id":"7ae9af21-9c38-4147-ab57-fd1ebad4e704","year":null},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.221492Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:8f419c232ccb6f63395b9e46a9617c066e4270f15978740bec13c08d8fc1b64e","observation_id":"c6350e41-27ab-4737-8f5c-33dab9fefd91","resolution":{"observed_at":"2026-08-15T16:30:35.967897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.943464Z","title":"Dynamic mdetr: A dynamic multimodal transformer decoder for visual grounding.TPAMI, 2023","venue":null,"work_id":"c2030892-ede3-44bc-9c71-20349f625e9a","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.226421Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:9a1e16b5c1b0c6d4a4361a80d781de3e15272dac4e233f79208ea774f80795ed","observation_id":"0cac53e5-3dc6-4e3d-bae4-d242df80734e","resolution":{"observed_at":"2026-08-15T16:30:35.950112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.925128Z","title":"Referring expression comprehension using language adaptive inference.arXiv, 2023","venue":null,"work_id":"1f4989ce-2f4b-4bc8-b97c-7f847edcc867","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.231395Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:9c4cbcf9fe47228d2039c01fc0ee3595453605e05ad02096872edbbc0a450439","observation_id":"bca06384-1eec-4415-8f6d-89d4c8f4f1d5","resolution":{"observed_at":"2026-08-15T16:30:35.931223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.907643Z","title":"Language adaptive weight generation for multi-task visual grounding","venue":null,"work_id":"6bed2199-af3a-4be7-b2f0-25c901a667a2","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.235964Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:84d0981482913545e3cbf3758f73d09bc9a22de8aa32f67be5eb4df8f6081927","observation_id":"6ce66470-8965-49ab-840f-7d3bd3b0c700","resolution":{"observed_at":"2026-08-15T16:30:35.912841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.890747Z","title":"Scan- former: Referring expression comprehension by iteratively scanning","venue":null,"work_id":"bb66a0e6-82a7-4996-b3b2-f5469323ba53","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.240828Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a4f3e3634ee397094a143a31d8b56ffb70f15e8554e4c38f4a5a42f32eebad4f","observation_id":"19ed48bb-2000-4160-9f9f-37ad610720a0","resolution":{"observed_at":"2026-08-15T16:30:35.896261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.874137Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"d7c2d925-8cff-4a8c-bc25-40c4f06710b3","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.245537Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:411a4b8b5f5f7c67e115b72a453c512160bef5d8b7f984f7a94aec6ce5cdc936","observation_id":"6c8e062f-8fc0-456f-ba6a-f414cb5f7802","resolution":{"observed_at":"2026-08-15T16:30:35.879593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.857931Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"674a76e1-6938-47e5-a503-14483ec19a98","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.250186Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:f33bec59b7df2568a8e4408776995c6eafad5f727ffdc260cb717ffbf58195ff","observation_id":"1cc41093-fc52-443e-b639-3b48ea7e9af3","resolution":{"observed_at":"2026-08-15T16:30:35.862796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.255166Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.255166Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:29cb4402489b5762d252ff7800c20276d32d4d1be16af8df941c0245145789b8","observation_id":"4830c549-6b98-4fbb-b057-c22005df6e8e","resolution":{"observed_at":"2026-08-15T16:30:35.255166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.828869Z","title":"Image as a foreign language: BEiT pretraining for vision and vision-language tasks","venue":null,"work_id":"a1355cc5-bc2b-4208-9d2b-ae144a7625ee","year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.259911Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:b43c564a3234ca578eab37287344ac284dabb9523d1365591a9cdb2f80bdf752","observation_id":"d8da6a70-a676-453f-8945-258cac8e28ed","resolution":{"observed_at":"2026-08-15T16:30:35.834626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.812795Z","title":"Towards robust referring image seg- mentation.TIP, 2024","venue":null,"work_id":"e7b89947-0141-406b-ac27-5b853767677d","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.264665Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:60acb143357a87427fdcd2b6ca6e104441090021e289ba51dcc266a79aebb3ff","observation_id":"c9c963d0-7533-4e75-8660-1fb99bfce7db","resolution":{"observed_at":"2026-08-15T16:30:35.817940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.795857Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"9815a51a-3ad3-4658-b27f-efe434416531","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.269731Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:97b963a5f33b2110a4e2df031be5b1b2df7eaa234079774068b7e85506e0dde5","observation_id":"0ecee307-80d2-40cc-95cf-6e46e31466bf","resolution":{"observed_at":"2026-08-15T16:30:35.801329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.779205Z","title":"Hivg: Hierarchical multimodal fine- grained modulation for visual grounding.ACMMM, 2024","venue":null,"work_id":"bbccfa51-4efa-4129-8663-05d6a004580b","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.274556Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:320261abc7af10b0f844641e43a3ace5f7c8fb4a98db84bea4ba35f54864e921","observation_id":"4a01011b-de54-4ebc-bc39-4e4c78c19010","resolution":{"observed_at":"2026-08-15T16:30:35.784340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.762601Z","title":"Oneref: Unified one-tower expression grounding and segmentation with mask referring modeling","venue":null,"work_id":"c380b195-ce3d-4b4c-adfc-aa49333aa1bf","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.279249Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:aabffcf40f7ce0734f5970104db1892f6689e808e6fa034eb87987d736d5f12e","observation_id":"44738b27-3913-4897-aada-5640ce390954","resolution":{"observed_at":"2026-08-15T16:30:35.768041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.284451Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.284451Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a2fb1ee0a6c79540b8fc14bd0e97fdc1f60c27ff74cda2cc07b3f1662e690691","observation_id":"836959df-9771-4384-a4bf-1ed401c0a9af","resolution":{"observed_at":"2026-08-15T16:30:35.284451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.734956Z","title":"Dynamic graph attention for referring expression comprehension","venue":null,"work_id":"7e5d9a9f-e8e8-4c93-94ec-bd4a9983d1d5","year":2019},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.289174Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:17a0392d5323509ecfcfda6c0a05cdb78940820e34d1064cf141cf79296c4ee4","observation_id":"4e74217d-010e-451a-a28b-327d1e6c6241","resolution":{"observed_at":"2026-08-15T16:30:35.740637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.719501Z","title":"A fast and accurate one- stage approach to visual grounding","venue":null,"work_id":"55535a43-e467-4bf7-bc12-40e6f16e4c85","year":2019},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.293880Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:e1ccdaf1bf8faa7bdef078dfcb0d01fcf86b546580de188a3e5f0464f5111a5e","observation_id":"822e4ae3-7b4c-4ab9-af00-c3f06b6850fd","resolution":{"observed_at":"2026-08-15T16:30:35.724371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.703448Z","title":"Improving one-stage visual grounding by recursive sub- query construction","venue":null,"work_id":"f2e0dfbb-932a-4b7a-aaaf-95613ddce6a9","year":2020},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.298759Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:d6c7f6c7d507c1d4cff2a046fff5b3e6a69858882f8b90ee657565cfaf9930af","observation_id":"48f7ddf1-77d5-4d11-a5f7-af02efef1280","resolution":{"observed_at":"2026-08-15T16:30:35.708922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.687912Z","title":null,"venue":null,"work_id":"24a7a09b-8ce5-4a5e-a702-d1e8d0fa90ed","year":2022},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.303409Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:2603c7e1d576c1d52c21706cf5f2b628328aa95cc8070520ca0c4f91bb2c120d","observation_id":"1eae3787-7c6b-4640-a029-d8c6ddafd3e9","resolution":{"observed_at":"2026-08-15T16:30:35.692693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.672039Z","title":"Vi- sual grounding with multi-modal conditional adaptation","venue":null,"work_id":"e2d1f2f8-470b-4959-b9a3-96ee3adb75f0","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.308818Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:423233be21db458f5361a0aea94f6b5aa83bc0010b11b813f553b7101ac3b1ea","observation_id":"1369d049-a50c-496a-9fd4-58214c734d32","resolution":{"observed_at":"2026-08-15T16:30:35.676989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.654486Z","title":"Shifting more attention to visual backbone: Query-modulated refinement networks for end-to-end visual grounding","venue":null,"work_id":"dfe2393c-96f2-4029-8120-573d43788749","year":2022},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.313464Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:dcd4372d766a6d0e28563046407a1f1dcc97d344b7bb0d8085c7fa992050f142","observation_id":"9efafb1b-51ab-4869-aaff-427580b3a811","resolution":{"observed_at":"2026-08-15T16:30:35.659931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.638372Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"34c99ed6-d262-4962-9f27-89fac10b38d8","year":2016},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.318075Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:6aa22070a7d3d83992e911fa0eb0e98c7b3690e17ce67a7efbae7890e2974f0c","observation_id":"444b17b7-9148-4eb2-ad9e-e584f7770cf2","resolution":{"observed_at":"2026-08-15T16:30:35.643366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.621839Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":"7e322169-8c71-4efa-8428-689de66b9b6c","year":2018},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.322938Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a8a5b8b69b92bb2b19bbe40f83bff36dcb78ddd7887672d932f7066ccf7fd2dd","observation_id":"4e3d6e39-29d7-4a08-a3bb-298fb7fe551a","resolution":{"observed_at":"2026-08-15T16:30:35.627068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.605274Z","title":"Rethinking diversified and discriminative proposal generation for visual grounding","venue":null,"work_id":"8f2c9baa-1570-4f9d-bbf5-b04b18c21e15","year":2018},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.327711Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:1ea2c1f390e42ce2c045ee2d0d6d44ea79d86ec254900c6dea30a5aa6618a8fd","observation_id":"76690098-45a2-4bb0-b574-853c9768ab29","resolution":{"observed_at":"2026-08-15T16:30:35.610460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.587159Z","title":"Grounding referring expressions in images by variational context","venue":null,"work_id":"5003cd89-0e29-497d-a0c1-b04ebf200efa","year":2018},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.332550Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:c700221ad5a588bf2d8998a1fbeeadf9a2b6d08fc7b8223dad610b98465f72cb","observation_id":"91917c24-a7c3-4e1d-b42e-51240562bbe3","resolution":{"observed_at":"2026-08-15T16:30:35.592875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.568773Z","title":"A real-time global inference network for one-stage referring expression comprehension.TNNLS, 2021","venue":null,"work_id":"3404f161-43c1-4c5f-ae3c-8480d07e2370","year":2021},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.337183Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:20561b622a95212b5375cecea04a913b89b5678ca59d7c72287ade285fd9fd9a","observation_id":"4b833189-8f1d-46d2-8710-e1503da078e0","resolution":{"observed_at":"2026-08-15T16:30:35.574058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.551850Z","title":"Seqtr: A simple yet universal network for visual grounding","venue":null,"work_id":"1fdf0ea8-dae6-4e5c-8094-f87dcfaec043","year":2022},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.342036Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:5000ec040d5d06f28eb95462ca617f278451e534851e746705260075f4e312d5","observation_id":"fbb17a52-45fe-422f-8fe3-f112aac949b7","resolution":{"observed_at":"2026-08-15T16:30:35.557219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.534336Z","title":"Deformable detr: Deformable transformers for end-to-end object detection.arXiv, 2020","venue":null,"work_id":"a1fb1d39-c768-4d30-b441-6deecaeb74d3","year":2020},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.347098Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:a414c5d07bdcf7890ca3c3bd5583fe45e9b751489db94190bc078fa3ae5c693a","observation_id":"f4d939e1-67a4-4e38-91bb-269d62f33721","resolution":{"observed_at":"2026-08-15T16:30:35.539668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.517210Z","title":"Parallel attention: A unified framework for visual object discovery through dialogs and queries","venue":null,"work_id":"5981dd3a-cbb0-44af-a809-1dea94d0e97b","year":2018},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.352020Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:1911c5de78e78ee3b188c1452b3dbf7cc488e51a251cbeebe9402ec8ac08e8d0","observation_id":"9e755d30-f0d0-43dc-ab66-0a18044358d4","resolution":{"observed_at":"2026-08-15T16:30:35.522471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.500287Z","title":"Falip: Visual prompt as foveal attention boosts clip zero-shot performance","venue":null,"work_id":"d136410f-7f27-460c-9a0b-52ea4c1a3670","year":2024},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.356830Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:020344bf6af7331112ba42990f33e18536d66da5e71c4854bcbe2af4cc62c28b","observation_id":"c47b8905-6027-43b6-899e-3bc202ea8df5","resolution":{"observed_at":"2026-08-15T16:30:35.505450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9870.4469","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:30:35.459370Z","title":"St3: Accelerating multimodal large lan- guage model by spatial-temporal visual token trimming","venue":null,"work_id":"e01178d5-79d3-49b6-99ef-13f6143626bb","year":2025},"citing_paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T16:30:35.361785Z"},"links":{"citing_paper":"/paper/2509.04833"},"observation_digest":"sha256:3f944ef3632b4be0e9e21538d0d2186ae553c0d5946cf2784984cef9a7a013a3","observation_id":"61e0df0b-52e8-4f9d-9c0e-98efbd4a8ba7","resolution":{"observed_at":"2026-08-15T16:30:35.469824Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04833","last_updated":"2025-09-05T06:30:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:24:06.767923Z","submitted_at":"2025-09-05T06:30:06Z","title":"PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":70},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2509.04833."}