{"as_of":"2026-08-04T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32b73cfc8dc1b47ed4b7ee8d4ff653f4459f4b6f0406497f3dfcad7ba012c27c","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:38:06.673737Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:38:06.673737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T21:41:15.213547Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"cited_work":{"arxiv_id":"2604.24036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24036","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","venue":"cs.CV","work_id":"7aae6dd0-10c7-43f2-9e22-ee3c73b65285","year":2026},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2604.24036","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:68e6ec342646bfb843df1c8c3fc941657ce977efc5de57bec7bd368422d00d47","observation_id":"a0160b1f-a493-4f02-a325-c6c6d50c4ffa","resolution":{"observed_at":"2026-05-11T21:41:15.218723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.24036/citation-record","integrity":"/paper/2604.24036/integrity","json":"/paper/2604.24036/citation-record.json","paper":"/paper/2604.24036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"cited_work":{"arxiv_id":"2604.24036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24036","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","venue":"cs.CV","work_id":"7aae6dd0-10c7-43f2-9e22-ee3c73b65285","year":2026},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2604.24036","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:68e6ec342646bfb843df1c8c3fc941657ce977efc5de57bec7bd368422d00d47","observation_id":"a0160b1f-a493-4f02-a325-c6c6d50c4ffa","resolution":{"observed_at":"2026-05-11T21:41:15.218723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"vehicle” “motorcycle","venue":null,"work_id":"fca1e466-1d99-4cd3-8d98-d267170fb222","year":null},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:f9ecce3678b0fc0e5ff0c55ec8588efdb770ba7a969242c82ada282859b52087","observation_id":"51a0d5df-3597-41c9-9e7a-55d007143218","resolution":{"observed_at":"2026-05-26T20:43:02.446195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The pedestrians carrying umbrellas","venue":null,"work_id":"896bdb45-92d2-4160-a3c6-8d530e1e307b","year":null},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:e8307ea55d494eef662d230e17edab88bb8bce74e123535f9e43ae277074b50a","observation_id":"313f9921-d4a7-4613-8f09-c53351899905","resolution":{"observed_at":"2026-05-26T20:43:02.451353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"These modules derive and integrate lingusitic semantic pri- ors, enhancing grounding robustness against occlusion and small objects in crowded scenes","venue":null,"work_id":"981f0fad-5698-4f4c-a9e2-772e5eeb8bfc","year":null},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:0be3637684125a513cbbea72588a9d7da0c0e28d3df239deb9c5b1762cc55aac","observation_id":"eb4f5b00-c628-4f00-976a-1f8831e0e61a","resolution":{"observed_at":"2026-05-26T20:43:02.459086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Additionally, the supercomputing resource was partially supported by KSC (KSC-2025-CRE-0090)","venue":null,"work_id":"14134b90-997e-4ed6-8578-fbe7e819faed","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:5f070e8e98c361ea10833d8e215f7d0f9258388302b40bcc056b731bc191ab9a","observation_id":"69f883f4-cc5a-4f24-9031-9f3686e96ce6","resolution":{"observed_at":"2026-05-26T20:43:02.463736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd2657ec-32ab-4637-9ff6-bea8fa9c9299","year":null},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:a4ed50804bf3262f855c2cb5df9a89df87ad7a583c163b6623fc9546e0b850be","observation_id":"5607226b-0c6e-4fb5-985c-eb6e444d81d7","resolution":{"observed_at":"2026-05-26T20:43:02.477340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:c48279be599804942f17c60b186d1de47ccd4c5f88fdb1658f81e5ddf05061b4","observation_id":"9b7c3978-2d3a-44ea-8062-ed68e294e9b3","resolution":{"observed_at":"2026-05-11T21:41:15.245554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T03:17:51.831519Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:9825394b7006390031441907b64415e56054645be88e2cf099b2269e78392ef4","observation_id":"2af1c8ad-4229-40d8-ba8e-fbd58212eb24","resolution":{"observed_at":"2026-05-11T21:41:15.229293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":"9a5b5c81-6822-4cdd-8ca6-c2299ced39ac","year":2023},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:d6937f373dc755777d31201bacbffb85528305b00e82fd4e400509fd4a8ec786","observation_id":"1594cc31-2fa4-4b68-ab46-ff4fe70cb395","resolution":{"observed_at":"2026-05-26T20:43:02.536078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-2: Grounding multimodal large lan- guage models to the world","venue":null,"work_id":"c513d240-f549-4a30-a921-1d60e3f9afe0","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:842c355d320917bb3b5ce1384495287a9f68ed9989011e4720ad47d1c62e0c4d","observation_id":"075897bc-3e6b-45bc-a436-4dc6bebf38a9","resolution":{"observed_at":"2026-05-26T20:43:02.489266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"2f874d3a-b56c-44ea-bf2d-2e35a05fc5bc","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:5f0e0cd5c18916e340b7ae5af871ecde585520e141689de48aec2743d8ded5bd","observation_id":"e05854a1-b585-478d-8d30-6cd280b73dc1","resolution":{"observed_at":"2026-05-26T20:43:02.572753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":"10e34673-5bcb-4400-94f2-cbd7af639024","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:f1177d8173d136547a684caf504bb88aee16ff32daf0122a542c56147d6b4b90","observation_id":"b2911d23-037c-4e7a-ac5e-65966a6b8be9","resolution":{"observed_at":"2026-05-26T20:43:02.560532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-02T05:48:34.429861Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:6d705115997a45285c29569e67a3de3d77d79b8cccd97a73f44553b7d54257db","observation_id":"c0b42aca-156c-4d4e-a81d-bc1744630647","resolution":{"observed_at":"2026-05-11T21:41:15.238967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling context in referring expressions","venue":null,"work_id":"c95ebfe6-7de7-4637-93cd-e494f14bd728","year":2016},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:8fa6a710254c0275128ba099d876b270732c3ce735bd8a3b5f284aae7cd4b833","observation_id":"deb17694-42ca-4949-b855-cc9c97cd2f28","resolution":{"observed_at":"2026-05-26T20:43:02.564282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generation and comprehension of unambigu- ous object descriptions","venue":null,"work_id":"deebf55a-808d-4cee-83a4-07f9f2d181af","year":2016},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:919ee31aa2d91dbca702dbe962c6e0d8a90d1cd8547b1b380d3825141f84179e","observation_id":"97cd706b-5a73-49eb-b496-2d4d3ea7d2c9","resolution":{"observed_at":"2026-05-26T20:43:02.548023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00123","last_updated":"2018-04-30T22:49:54Z","snapshot_observed_at":"2026-07-06T06:36:33.930118Z","submitted_at":"2018-04-30T22:49:54Z","title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","version":1},"cited_work":{"arxiv_id":"1805.00123","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.00123","snapshot_observed_at":"2026-07-08T02:04:26.435100Z","title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","venue":"cs.CV","work_id":"6730f6db-fad4-4f43-97e5-e7cc95382bc9","year":2018},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/1805.00123","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:891f744187eaf6074193483b2ee4175c5d464a81f4bf283fc72c92da3bced61d","observation_id":"424a1474-5d98-4aab-9ebe-021720792dc2","resolution":{"observed_at":"2026-05-11T21:41:15.263199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visdrone-det2019: The vision meets drone object detection in image challenge results","venue":null,"work_id":"e1c35b7c-d1de-4f29-b615-6a3475d8aca6","year":2019},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:609024002f285b0208441b7d8ebf84b72904df6dffe1e53c803f45f3bc55ed73","observation_id":"6371b8be-e3dd-4598-819a-d2e945f019dc","resolution":{"observed_at":"2026-05-26T20:43:02.555748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unmanned aerial vehicle benchmark: Object detection and tracking","venue":null,"work_id":"3009f9e8-4631-48f9-a339-a633c2816ccb","year":2018},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:54495f805d21088209bb1cb516ad6f82bc646acc1939594f14de8c271b6dc87d","observation_id":"7e47a030-e1bc-4f9a-91ef-7531033e1482","resolution":{"observed_at":"2026-05-26T20:43:02.552013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.00392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:24:02.161102Z","title":"Refdrone: A challenging benchmark for referring expression comprehension in drone scenes","venue":null,"work_id":"cb62a8fb-7bbc-4dab-bf68-43f03ff19175","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:a5c35a461b6d594d263ecf0bb57a39c553a3df33f788f368caa708da9834cf43","observation_id":"16bb2646-2a81-4f26-b1fb-5ea59daa723f","resolution":{"observed_at":"2026-05-11T21:41:15.255524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language can boost otherwise unseen ob- jects into visual awareness","venue":null,"work_id":"795d217b-f5f5-4ed1-81ad-f95ba21e0f22","year":2013},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:aeb3f079df9b40562d593573b98a584abdf57bb0345f08da0974a96b425cebd3","observation_id":"5f92e2cd-f9bf-4b65-92bb-076b74dbe8db","resolution":{"observed_at":"2026-05-26T20:43:02.568845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Words jump-start vision: A label advan- tage in object recognition","venue":null,"work_id":"c2dcd72e-7405-4c75-ba58-bfd0e66845ce","year":2015},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:49ee751e7688d7fb0cc879cef29f5709a9eadf686308a4417c963baf1200f624","observation_id":"24d41887-ea99-42ba-a59d-dd05ed048dce","resolution":{"observed_at":"2026-05-26T20:43:02.544060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weather-aware drone-view object detection via environmental context understanding","venue":null,"work_id":"d6215735-ed8a-475e-970e-80ec025780b6","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:2db0661f189bd569e86d94d767a4b88fa0ba7c5a8b6ca7bf2951f427aa1432f0","observation_id":"b74d33f4-b2de-44d5-97d3-2993e3db0e06","resolution":{"observed_at":"2026-05-26T20:43:02.576533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23193","last_updated":"2025-05-29T07:31:39Z","snapshot_observed_at":"2026-07-06T21:32:47.853691Z","submitted_at":"2025-05-29T07:31:39Z","title":"Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images","version":1},"cited_work":{"arxiv_id":"2505.23193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language-guided learning for object detection tackling multiple variations in aerial images","venue":null,"work_id":"0c3fabb4-017d-4bde-9872-89bf6c774357","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2505.23193","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:57431e1cef45e7a4ac085c943f6448d7262bc8a46c29206e99b21ad0a21370c9","observation_id":"f0dcedd0-f893-41c4-8377-4992dee0d7f9","resolution":{"observed_at":"2026-05-11T21:41:15.271640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moai: Mixture of all intelligence for large language and vision models","venue":null,"work_id":"c394e3b8-719b-4c75-949a-05c9ff484efc","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:e32b5ccc2ee99acac654e6f6c3cbcba09a1517964aced3148f2250de399cb9bb","observation_id":"b9fed8b5-a027-4db1-8d40-e578a2e802e5","resolution":{"observed_at":"2026-05-26T20:43:02.524479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Citypersons: A diverse dataset for pedestrian detection","venue":null,"work_id":"21985df1-3299-41d4-9c13-52e69ec63770","year":2017},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:30e058649a74a3a85648fa61f3e7a5b3404162ecdc3110eb3233ea39420fab34","observation_id":"5311179a-7c25-436c-aee7-3aca1bc96c42","resolution":{"observed_at":"2026-05-26T20:43:02.509617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Widerperson: A diverse dataset for dense pedestrian detection in the wild","venue":null,"work_id":"f8741702-6066-45d5-87f4-7193002114ce","year":2019},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:4e2ae1599593b200a918a7f0fd0ead801f77155a5746680c06e63c05b485b469","observation_id":"f93928b3-f4c2-4bda-8db9-1aa041d2afa3","resolution":{"observed_at":"2026-05-26T20:43:02.441073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19833","last_updated":"2025-05-26T05:15:33Z","snapshot_observed_at":"2026-07-06T19:24:12.811792Z","submitted_at":"2024-09-30T00:11:40Z","title":"HazyDet: Open-Source Benchmark for Drone-View Object Detection with Depth-Cues in Hazy Scenes","version":2},"cited_work":{"arxiv_id":"2409.19833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19833","snapshot_observed_at":"2026-06-28T22:42:46.688417Z","title":"Hazydet: Open-source benchmark for drone-view object detec- tion with depth-cues in hazy scenes","venue":null,"work_id":"4d0c5102-b7f1-4d13-9966-8257c60272d9","year":2025},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2409.19833","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:0034a7e36d49551425872ae249766198125da067647d30f8512bf410f1b2f4b9","observation_id":"24dec3c1-7d14-433d-a09a-39ed426da67e","resolution":{"observed_at":"2026-05-11T21:41:15.210278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"bb479736-1253-41e2-a684-d6971abddda2","year":2020},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:55f26b1ae71dd291069ecea7a74a4b7ef82f2b4bac4cfdb0efee743437f05d7c","observation_id":"0648ae53-a755-4d55-a2e0-bdcdd6f58c4b","resolution":{"observed_at":"2026-05-26T20:43:02.481858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A convnet for the 2020s","venue":null,"work_id":"b15ba330-32b3-469e-b76c-6327dbc4947e","year":2022},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:f5566318bc81cac53beb89d3d8596db524d2438b8dfb2ec6e9c63a28a67ff565","observation_id":"80c2269c-3dd6-4558-b319-dce2eee5d0fd","resolution":{"observed_at":"2026-05-26T20:43:02.500008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impress- ing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"5758f59e-3b70-4ebc-8fb1-b6ce90f96d99","year":2023},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:c987810e83490207bb79e44a8025885bad5a49f78f579ec6c42ba472de6fddfb","observation_id":"e40e722b-a530-41d3-ab55-797e51f27aea","resolution":{"observed_at":"2026-05-26T20:43:02.505626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T-rex2: Towards generic object detection via text-visual prompt synergy","venue":null,"work_id":"139f46c9-28d5-4852-92f6-d45a167b40df","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:406a7a842e0ce7b4d538290d12f33faf8f769c427393d930568122c67b221cc8","observation_id":"53bd0878-64a5-4ce5-92ce-cd644cd29651","resolution":{"observed_at":"2026-05-26T20:43:02.515368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detrs beat yolos on real-time object detection","venue":null,"work_id":"99583158-03aa-4554-ad46-58df8c1d9bf2","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:c3168b2eace6bd04997953b24f36b9f2bd1cc98e74d358a2735091eb146d1327","observation_id":"ad6756e3-f0fe-46da-848d-3f0252bd96d0","resolution":{"observed_at":"2026-05-26T20:43:02.519975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask r-cnn","venue":null,"work_id":"7c542bef-0d69-4639-ab99-1e16c4fcc072","year":2017},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:56070103167f9fe44f65f9b2bbe3293413d414f0307fa1a08a1657c6d45bb20f","observation_id":"6fd53837-d088-40b8-8399-cc30fc18e4f4","resolution":{"observed_at":"2026-05-26T20:43:02.531625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:9873f298eeb950972b350d2b261c0af598a6837a301fca264e3122bb0a9af829","observation_id":"a266671a-b802-4be4-82ed-250b452d2cde","resolution":{"observed_at":"2026-05-11T21:41:15.279343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-convnextlarge d 320.laion2b-s29b-b131k- ft-soup","venue":null,"work_id":"d2a3e7fc-ff47-4c99-9190-eb658bbfd961","year":2023},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:495b0ec38556e2622e688abdca1c086d6607c72d2fd9f249886d8deb9c19da31","observation_id":"27ad2295-0e18-44ee-a99b-70fb74035341","resolution":{"observed_at":"2026-05-26T20:43:02.485502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"37068f4f-61c1-458d-884f-15a83eb69b5f","year":2017},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:20738c99e1fdc71439d79b877f2be0a1c04d53d3481847313fbacdf79dff091e","observation_id":"c4c26015-5085-4464-95b8-8d89801e34dd","resolution":{"observed_at":"2026-05-26T20:43:02.493347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"df825479-df4f-4432-a419-f0796a7e1bdc","year":2014},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:b78fd11ab5362991e8aa3883568cd8f41303f5976cfadabf8853696952bb9eab","observation_id":"6af14882-c6dc-47a1-95b6-13f418da74bb","resolution":{"observed_at":"2026-05-26T20:43:02.539823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"49eacb4a-94a5-4aa6-991d-32ceef14927d","year":2019},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:af55930ef7dc2aa88c416dc7f8f0fab751340a706e10743cd1ba04f4d51b02b4","observation_id":"017d1ecf-4746-40f5-b112-dc4639dcbb57","resolution":{"observed_at":"2026-05-26T20:43:02.467564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meteor: An automatic metric for mt evalu- ation with improved correlation with human judgments","venue":null,"work_id":"a63da476-b7e1-4d61-ac2f-5146904e2ce0","year":2005},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:6f2e002faee68cb4442097f9e17dc86f1c60866fd1329df462b870dd02c088e1","observation_id":"0119df1a-7a5d-42b1-8612-20e74770b16b","resolution":{"observed_at":"2026-05-26T20:43:02.471494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"82b9bf92-68cf-45b5-93b7-8aa6e2f074c7","year":2015},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:d17829e8792ab9a004ba7e3cdf3e77b4ab3e232c9ab8cd27d24da047a229153c","observation_id":"84533ec3-5232-4497-a586-e40ab5bb527d","resolution":{"observed_at":"2026-05-26T20:43:02.436924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":30},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2604.24036."}