{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e22e4a8f57db0b1a328e9bdf0782d167e31f1a1e1e89d69b99356d51daf0bbbb","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:22:13.267737Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:01:03.556212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T23:18:25.494068Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2512.24561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-01T02:17:18.600387Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":"15aebe2a-8f98-48ac-bf6e-3179dfa95699","year":2025},"citing_paper":{"arxiv_id":"2604.00270","last_updated":"2026-06-05T03:05:20Z","snapshot_observed_at":"2026-08-11T14:51:37.103221Z","submitted_at":"2026-03-31T21:51:36Z","title":"OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T23:17:45.005518Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2604.00270"},"observation_digest":"sha256:399da9ac00046aaf42cd12ec11ae188d59090b70c2d2de72d9512ca63e173dcf","observation_id":"627a73fa-a568-4ebf-95f0-97a79ed31635","resolution":{"observed_at":"2026-07-01T02:17:18.600387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-13T15:15:25.977993Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.00270","last_updated":"2026-06-05T03:05:20Z","snapshot_observed_at":"2026-08-11T14:51:37.103221Z","submitted_at":"2026-03-31T21:51:36Z","title":"OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T15:15:25.977993Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2604.00270"},"observation_digest":"sha256:536f843860fd890f6d9326bb065e528c64746dbb5d123a62441c14c01c750b02","observation_id":"88a6f25c-1961-4add-97de-c2a9524ed012","resolution":{"observed_at":"2026-07-13T15:15:25.977993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2512.24561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-01T02:17:18.600387Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":"15aebe2a-8f98-48ac-bf6e-3179dfa95699","year":2025},"citing_paper":{"arxiv_id":"2605.02258","last_updated":"2026-07-29T02:01:36Z","snapshot_observed_at":"2026-08-11T02:16:58.355721Z","submitted_at":"2026-05-04T06:09:13Z","title":"SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:23.516635Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2605.02258"},"observation_digest":"sha256:35af4e84f0b9b93ba3495ed665b9eddc5b8bbc9fdffd3f36b94d14c890b1c94a","observation_id":"bc4d7ac6-4525-4f87-9402-b4fb9e1bb77a","resolution":{"observed_at":"2026-07-01T02:17:18.600387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-08-02T15:01:03.556212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.02258","last_updated":"2026-07-29T02:01:36Z","snapshot_observed_at":"2026-08-11T02:16:58.355721Z","submitted_at":"2026-05-04T06:09:13Z","title":"SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T15:01:03.556212Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2605.02258"},"observation_digest":"sha256:a009db4ab61425dc589a2bbe33b104f6b53dc645b9209c3b1f3a9c40a96c1789","observation_id":"5199272c-3e9f-4c74-9573-f11b653460ee","resolution":{"observed_at":"2026-08-02T15:01:03.556212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.24561/citation-record","integrity":"/paper/2512.24561/integrity","json":"/paper/2512.24561/citation-record.json","paper":"/paper/2512.24561"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.475422Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.475422Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:69e90a7e933e8090d0fed4917d2de9df3c1881064dd1fc7f3ece18f8514161e1","observation_id":"1407b649-e64b-40d9-8988-2a1232010af3","resolution":{"observed_at":"2026-08-03T13:22:07.475422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.532784Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.532784Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:98496f837703305de9bffe14a67ed570a1ecb4fbe40bc06ccadad8de1c38d392","observation_id":"bb100858-17d2-40bd-8059-6adb8e7479c1","resolution":{"observed_at":"2026-08-03T13:22:07.532784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.598268Z","title":"Cops-ref: A new dataset and task on composi- tional referring expression comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.598268Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:03555adf06eb0f56b618a6feba9b3eb52d8cc210053dcb405d93a1ba0c8c3417","observation_id":"1ee842d9-9938-44b3-8875-9f63b5e079d2","resolution":{"observed_at":"2026-08-03T13:22:07.598268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.673878Z","title":"Unit3d: A unified transformer for 3d dense captioning and visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.673878Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:18bc1e6bd20f936e3f70fb8738b8e64b659c39df59a66dc19bee7c20837a4284","observation_id":"4f01e7a2-af88-41f5-81fe-71e9cd1c16a8","resolution":{"observed_at":"2026-08-03T13:22:07.673878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.741282Z","title":"Advancing visual grounding with scene knowl- edge: Benchmark and method","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.741282Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6d187fa9f9404001c303e025e1900c078f4cc41bfdaefe22e3a581ba7043f8d2","observation_id":"7e262af5-d149-42b1-92a0-23ca710517fe","resolution":{"observed_at":"2026-08-03T13:22:07.741282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.814739Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.814739Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:e8616a796018a974f5559dbeb6699b438422b55177a6840591257574f42c5f98","observation_id":"c45022d3-1c20-4f82-9414-230b44a1a92e","resolution":{"observed_at":"2026-08-03T13:22:07.814739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.875627Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.875627Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:83768ac108f9952e6d0cd6e73537acd9f92bb50081c8f64e6a8435397e70e458","observation_id":"309e8538-795e-47ea-a566-b1d1f7993058","resolution":{"observed_at":"2026-08-03T13:22:07.875627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.982432Z","title":"D3t: Distinctive dual-domain teacher zigzagging across rgb- thermal gap for domain-adaptive object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.982432Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0e9740226ff0e21328d5e23b074f53204670f0f122382acb5a68513dd5dec3cd","observation_id":"49a85298-a2b6-4d7a-99f7-a5e211ef41ab","resolution":{"observed_at":"2026-08-03T13:22:07.982432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T13:22:08.081744Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.081744Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f07ae236d67836d4d1404e14d6da5cc396789ec13d4da09f14195d7db742b64d","observation_id":"0af4a103-7809-46c1-9dc7-8b4af125131b","resolution":{"observed_at":"2026-08-03T13:22:08.081744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.183519Z","title":"Large-scale adversarial training for vision- and-language representation learning.NeurIPS, 33:6616– 6628, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.183519Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d468ba14942fae63073ae1901d782d2df0145904099f7dc187d4e2842bce8884","observation_id":"bdd8dfea-ecb2-4268-8898-5ba49f84d6a4","resolution":{"observed_at":"2026-08-03T13:22:08.183519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.253760Z","title":"Room-and-object aware knowledge reasoning for remote embodied referring expression","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.253760Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:8c6015e18f0cbcc40ba192b93a04ad5e8d36a1227d1e006ee7a6ecee0e624290","observation_id":"fec1444d-f117-40fc-b782-b787c38ec76d","resolution":{"observed_at":"2026-08-03T13:22:08.253760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.349314Z","title":"The iapr tc-12 benchmark: A new eval- uation resource for visual information systems","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.349314Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f6e8a5567ad660701c3889d1ab036a952be172b31930b6b3ca38d2d86d8d4db6","observation_id":"b0f35396-7226-4bdd-bae3-aeb7dbf0eff2","resolution":{"observed_at":"2026-08-03T13:22:08.349314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.447263Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.447263Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:5c1be2b4d207713fdf1c23b78533f5811511cc072213726a76ca992c6b902e51","observation_id":"cc6a1b54-228b-4f93-a57e-b5970a8e6004","resolution":{"observed_at":"2026-08-03T13:22:08.447263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.559249Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.559249Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:810b679d1123fa403e4f3c0ebb3f08cf98016fbef3b2b05563caa3fff9290f90","observation_id":"a4bddb92-2038-49c6-b0a5-b5ccd64e6ac0","resolution":{"observed_at":"2026-08-03T13:22:08.559249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.727448Z","title":"Ei 2 det: Edge-guided illumination-aware interactive learning for visible-infrared object detection.TCSVT, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.727448Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:2146ba606169dfa1f90c70fad917fb829a11d7b3d5e691a7144d28fd262b4855","observation_id":"7db8483a-6139-4464-94e5-d1b3dd79514a","resolution":{"observed_at":"2026-08-03T13:22:08.727448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.836138Z","title":"Beyond one-to-one: Re- thinking the referring image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.836138Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:bdb13816594eccb144d3bcd2bf1ef25f64987dbd5b867f2bf011cb028fe8a05f","observation_id":"d41f7c38-41e1-478f-9bea-ac274ef82114","resolution":{"observed_at":"2026-08-03T13:22:08.836138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.924987Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.924987Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:db25ee3e18def42e39ad7165e47d96ce693540e97077471aba5b439bc7c2d750","observation_id":"2e61ec8c-4d4e-468c-8cd5-b5de161dd86f","resolution":{"observed_at":"2026-08-03T13:22:08.924987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.997393Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.997393Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:986d37c0df9c6fd560e8f1550d7fbffb080f9018d0d468d9718c564aefa14926","observation_id":"4f621396-d7f2-4d0c-857b-b445360ee236","resolution":{"observed_at":"2026-08-03T13:22:08.997393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.187025Z","title":"Rgb-t semantic segmentation with location, activation, and sharpening.TCSVT, 33(3):1223–1235, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.187025Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:62b2821dd9fcd389c63defd8b52471dd85289afde1f3221f066dfc48d00f4dcf","observation_id":"567a5f88-d237-42e1-a838-7af3bed1a193","resolution":{"observed_at":"2026-08-03T13:22:09.187025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.301713Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.301713Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:44dc29386f58f52c30e47ce0d200817912f7b7b12626056a7c14fbf1e4f6431a","observation_id":"da724d24-8ca5-4d5b-af96-fad6aa94cef9","resolution":{"observed_at":"2026-08-03T13:22:09.301713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.356679Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.356679Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6af46c9d96c403545f541a8e10fa4bf8e247364f841b5db79668d090fdf7ea89","observation_id":"0f038089-9ff8-44a7-93b0-98721e65a4cd","resolution":{"observed_at":"2026-08-03T13:22:09.356679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.469324Z","title":"Refer-it-in-rgbd: A bottom-up ap- proach for 3d visual grounding in rgbd images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.469324Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c3271cbc4de5d6d65fd9e6779d9e1cfe913743609ae1d6891ed5c1a12aca0de8","observation_id":"91129e57-d05f-4298-9e37-598bc2d60a90","resolution":{"observed_at":"2026-08-03T13:22:09.469324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.627654Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.627654Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:61f0be577f7ecf79326d276c8cce50ba1611376d9d61c2ae2638204f327f8d98","observation_id":"805d9a1c-b4cc-4c9d-a0bb-5c60bdf049ce","resolution":{"observed_at":"2026-08-03T13:22:09.627654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.685054Z","title":"Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.685054Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:14f35af50f09e08e08ade6900ae7815159aaa514a3365fb2e86b6abd9184f674","observation_id":"ef9c6c3c-4cfd-49bc-acf8-1c69cd8fed7d","resolution":{"observed_at":"2026-08-03T13:22:09.685054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.797495Z","title":"Cross3dvg: Cross-dataset 3d visual grounding on different rgb-d scans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.797495Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:72879bd1859925e73cc124bed1ad2003a55affc4cfcc3e071b277b1b53f64875","observation_id":"2edb6309-ac5c-4d98-8c91-1603d2351ad4","resolution":{"observed_at":"2026-08-03T13:22:09.797495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.957036Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.957036Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6aaf31178b88efbd2ce9fbfe137e5ae11712aa9524e31d1c010bfbdc05e669fa","observation_id":"959bbfc9-1512-42d2-9499-e1385b44ed0f","resolution":{"observed_at":"2026-08-03T13:22:09.957036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.034272Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.034272Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:5e7b651e12d54f5b44f34f563a971ebad62c5f0b587a4ec14eecf0c6f56a09f2","observation_id":"a25a0121-4167-462c-b42c-b046a3549897","resolution":{"observed_at":"2026-08-03T13:22:10.034272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.056944Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.056944Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:da70fdc2c420d3c4bbf519dd14b24917bc3a69e29efcda102504b3466e1f5f4d","observation_id":"031b6ad1-fc67-4964-bacc-bea7a1ee9cf7","resolution":{"observed_at":"2026-08-03T13:22:10.056944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.132196Z","title":"Dynamic mdetr: A dynamic multimodal transformer decoder for visual grounding.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(2):1181–1198, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.132196Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:97882b4091cd0073d915ad2c0eae2b071b352b4d445e219b2e97dc198c510b52","observation_id":"eb5116eb-af16-4e42-937b-d9932eec4ee4","resolution":{"observed_at":"2026-08-03T13:22:10.132196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.165003Z","title":"Attention is all you need.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.165003Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ef0d78350d9d733d6d6ddfad33f3990684c23722b584668b76ebf6e8737f0d07","observation_id":"869f0c3c-cdca-453f-9644-63d37f1169f5","resolution":{"observed_at":"2026-08-03T13:22:10.165003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.222723Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.222723Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ee3ee14bc9be96ba24c8fa4680e1d696533fc48f5252cab325a3fbb0a7ea8852","observation_id":"e8659ac2-f1dd-4ebf-a7c2-4e7b6a7a8794","resolution":{"observed_at":"2026-08-03T13:22:10.222723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.291114Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.291114Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:e9e100d4f546c2146ea098345f297488ec88c32e45c44e31bea3e2e3677acd23","observation_id":"aa35b809-d83d-43ca-a718-0ed735563433","resolution":{"observed_at":"2026-08-03T13:22:10.291114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.359561Z","title":"Clip-vg: Self-paced curriculum adapting of clip for visual grounding.TMM, 26:4334–4347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.359561Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:06de645d9ccf44eb910dab2f197f98e487cec2b5f46b1a4e7d781500e6551055","observation_id":"a43b6454-1678-48d8-b9d4-e4e4a696c5cb","resolution":{"observed_at":"2026-08-03T13:22:10.359561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.534984Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.534984Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:071721a0f428c6972694dcb14709788565cf45e18f62865bf692b07898bda393","observation_id":"ceb9017f-6716-48c9-bdeb-10dcb348b875","resolution":{"observed_at":"2026-08-03T13:22:10.534984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.608296Z","title":"Hivg: Hierarchical multimodal fine- grained modulation for visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.608296Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:4ecf13ba5c843dc6c5ec0a1af8bef514905b992cc683c565ac72294e5e73c26d","observation_id":"9cbcbc35-a951-4641-b7ab-2c7b948aa364","resolution":{"observed_at":"2026-08-03T13:22:10.608296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.690297Z","title":"Oneref: Unified one-tower expression grounding and segmentation with mask referring modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.690297Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:5030955f74b0f51f611b959b5dc40e322eeef2b6576ef635728f76c8c8307488","observation_id":"1a5d5a3c-e6fa-4de4-81e3-4fa0ff4433bf","resolution":{"observed_at":"2026-08-03T13:22:10.690297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.751759Z","title":"Described object detection: Liberating ob- ject detection with flexible expressions.NeurIPS, 36:79095– 79107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.751759Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d0216c7db488ea77162c8bd09c27ff7603bc42a1bae4b748bc01171d44f3fabe","observation_id":"894c0ae2-e442-40e5-bf4b-3d0ed8e4c595","resolution":{"observed_at":"2026-08-03T13:22:10.751759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.859018Z","title":"Mc-bench: A bench- mark for multi-context visual grounding in the era of mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.859018Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:71e5000e09729031710edd66865bac4122f502f364e61c8c04475632b04f1b38","observation_id":"12bd4718-e362-4862-b9b4-8c237dc051b9","resolution":{"observed_at":"2026-08-03T13:22:10.859018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.963077Z","title":"Improving one-stage visual grounding by recursive sub-query construction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.963077Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:29bbd280a8e8874d7e8d4719d94440b344da10ef9c2028158b674e4dd1e033ba","observation_id":"a5317b8b-90d2-4892-949b-1340eea2232c","resolution":{"observed_at":"2026-08-03T13:22:10.963077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.074241Z","title":"Unitab: Unifying text and box outputs for grounded vision- language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.074241Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c2d29d50789a03db7aba398820ee736592367ecd34203212ddbd40208dd10b5e","observation_id":"0e63b9eb-7172-4b40-80d8-6b4f06347bfc","resolution":{"observed_at":"2026-08-03T13:22:11.074241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.136609Z","title":"Vi- sual grounding with multi-modal conditional adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.136609Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c7ca53d2cbcb9c57a37d73e64c8055f465583b19155bbde68b1d46e251d31d3f","observation_id":"1cb76a83-6046-4b61-a18b-eb439b5d1d27","resolution":{"observed_at":"2026-08-03T13:22:11.136609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.208551Z","title":"Shifting more attention to visual backbone: Query-modulated refinement networks for end-to-end visual grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.208551Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3ff9f2df703a43134ba1f60e25ba2c16e7c8e5a90a038d083c8467958ba338d5","observation_id":"2c7be307-2a62-4605-a87a-d3324ed593d0","resolution":{"observed_at":"2026-08-03T13:22:11.208551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.270069Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.270069Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c5873281288f8b5e2efece658f894c0c93c06795d1e298ec29ea5a366f36ac2d","observation_id":"183bb79e-93ef-4873-9853-bf4a36d29ada","resolution":{"observed_at":"2026-08-03T13:22:11.270069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.310614Z","title":"C 2former: Calibrated and complementary transformer for rgb-infrared object de- tection.TGRS, 62:1–12, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.310614Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:e25e5fe7a323323ee487a4db07b7cca039a76220371265ebbdd436bde8fa9a70","observation_id":"ac0055fa-fcb5-4ab3-915c-2aedee084a49","resolution":{"observed_at":"2026-08-03T13:22:11.310614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.392019Z","title":"Trans- lation, scale and rotation: Cross-modal alignment meets rgb-infrared vehicle detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.392019Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:94ad6782e5ca73398321d09aa569bc5964bdd2e3eb500ab146af58d4afd351a4","observation_id":"f90310fa-9edf-45f6-8e1c-d43a87e061ba","resolution":{"observed_at":"2026-08-03T13:22:11.392019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.462234Z","title":"Improving rgb-infrared object detection with cascade alignment-guided transformer.Information Fusion, 105:102246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.462234Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6b033e36638b0aa6bcd98f6ff65a773d11199bde61fa916157ae6719be56d50a","observation_id":"019f9ec1-96dc-4537-91fa-742ced008088","resolution":{"observed_at":"2026-08-03T13:22:11.462234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.542644Z","title":"Unirgb-ir: A unified frame- work for visible-infrared semantic tasks via adapter tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.542644Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:aaa2e974cfb453b1f6327727f317553993b0f0a48cb9b41913de37f021581af3","observation_id":"7933f4bf-8206-414e-9d2f-76a2fef01119","resolution":{"observed_at":"2026-08-03T13:22:11.542644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.610798Z","title":"Multispectral fusion for object detection with cyclic fuse-and-refine blocks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.610798Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:4baa19103b72b45afebbd6b730505ca1daca4166748d673424345eab3c263499","observation_id":"5dc45d55-c7c5-452b-95b5-0ee8441e4abf","resolution":{"observed_at":"2026-08-03T13:22:11.610798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.644623Z","title":"Abmdrnet: Adaptive-weighted bi-directional modality difference reduc- tion network for rgb-t semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.644623Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:4d03098dd871a70206542d7181dda12d4b4e27cf5d0f7ce92e9506999c518e56","observation_id":"ee7be17c-9ea4-40a8-88c4-0ed0c8c9468e","resolution":{"observed_at":"2026-08-03T13:22:11.644623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.726883Z","title":"Removal then selection: A coarse-to-fine fusion perspective for rgb-infrared object detection.arXiv e-prints, pages arXiv–2401, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.726883Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:685bd6bebc4d8cadfb247f9a2602d86b46eea4d58a5b1b6e42ba880f6ccc491a","observation_id":"81ffd4b3-5722-4dc6-a3e6-57e85c43e6d4","resolution":{"observed_at":"2026-08-03T13:22:11.726883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.831105Z","title":"be- hind the truck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.831105Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:589c2625feb4ded452313d4c9b0a6d9dd44d93332b21c0c98dceae43ca0f144f","observation_id":"e354113d-a2f4-4527-8820-a55cb53aab71","resolution":{"observed_at":"2026-08-03T13:22:11.831105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.914135Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.914135Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:fc1dafa1b84c72e6452e2b8fcc999b85ba63cad5d2896918e4dd22ed46d82b02","observation_id":"c1623795-31fe-4d43-b53b-225543485a47","resolution":{"observed_at":"2026-08-03T13:22:11.914135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.001270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.001270Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6c096e83cedc75884d16c7d3ccf57ab308abb1a33c2c2ee960aa1ed1eb0aa036","observation_id":"edfd31a8-d30e-41d2-b6fc-ff48332fbe89","resolution":{"observed_at":"2026-08-03T13:22:12.001270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.187388Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.187388Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:7c106ee50e68e62644c9977f281836e2e571d6126f9bd232dd67ec3470fe919b","observation_id":"c2fb9113-c4ab-4fc6-b8f0-796a559df62c","resolution":{"observed_at":"2026-08-03T13:22:12.187388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.218174Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.218174Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0083015b8e4e82ca68b2adb6b9b424f26709ea6668905ac00d339dd018373f30","observation_id":"f96a5e63-4701-43df-b6b6-4fd64bd69e3e","resolution":{"observed_at":"2026-08-03T13:22:12.218174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.304908Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.304908Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:529229e06633cdfd56853874f2b254b00143c90dd934f8a4c38966dbb882dac9","observation_id":"f32a7b6f-b590-4184-867f-954a7f47a86c","resolution":{"observed_at":"2026-08-03T13:22:12.304908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.488625Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.488625Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f46febe04c87f65769b93c5847705d11534fa1ac0ce151235f7ff9a006327a9a","observation_id":"0a7c6681-4264-499d-bf3a-75c1b9f15d4d","resolution":{"observed_at":"2026-08-03T13:22:12.488625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.615969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.615969Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6e73ff33e5f69ed371c6f744a6232b4085716b422a6c0dc8d716f755b058d83c","observation_id":"38d3df62-5325-4b4b-a79a-586a1f9b87c8","resolution":{"observed_at":"2026-08-03T13:22:12.615969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.686063Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.686063Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:7567ee85afb40068e70db5101f92baf7f69ad0c8a642a97d5d15a775686ad351","observation_id":"8540625b-e574-43fd-ac62-002f82383d36","resolution":{"observed_at":"2026-08-03T13:22:12.686063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.756090Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.756090Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:866244fcd29621cd855cc5a3dbd53738dd3088d87702941506f1c1bdcf53690d","observation_id":"400a225d-e54d-46b3-838d-7cec33fbae08","resolution":{"observed_at":"2026-08-03T13:22:12.756090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.820399Z","title":"near the stairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.820399Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:94d34c4c20dbafe898db4ce0f8ecb35318007fe6a41679e7a5d4b50548ac3555","observation_id":"7beeb4e8-13a5-4879-bb26-19bbae99ffcc","resolution":{"observed_at":"2026-08-03T13:22:12.820399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.879990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.879990Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ae131b33d3f084e7be5600b28142828209596edbcb3f7418a179e729c1c542eb","observation_id":"386a503d-75d2-4be4-93ec-f822478cd406","resolution":{"observed_at":"2026-08-03T13:22:12.879990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.957929Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.957929Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:a0ed836606fc0ff1b9b57f7be88ef13f63e75bedd860140f58b5c4fa5f5667f0","observation_id":"4919d6e8-abb9-4622-94ab-c7e6a8db808f","resolution":{"observed_at":"2026-08-03T13:22:12.957929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.979078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.979078Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:a9242d705372de33eb5df7ec2044adca440fd38beb9be8cf8ebdaa701f6fa273","observation_id":"bf3a12b4-79e7-4ca7-9f1a-43aa71c047d2","resolution":{"observed_at":"2026-08-03T13:22:12.979078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.007925Z","title":"Please return only one number corresponding to the lighting condition: 0 (very_weak_light), 1 (weak_light), 2 (normal_light), or 3 ( strong_light)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.007925Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c4ff3d03e17794f90d9bf0e29476c7b2b681b95f272394cfd7ec3fd52e53e9eb","observation_id":"9c91cae0-6661-4ba5-a87e-7c2c9c824b6b","resolution":{"observed_at":"2026-08-03T13:22:13.007925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.051235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.051235Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:a795c2fb46d015861191bfc103313b064a28ac1bfc8c067da838c1baf6f9a3cb","observation_id":"f67d87e2-450c-474c-ae53-981ab63e3435","resolution":{"observed_at":"2026-08-03T13:22:13.051235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.131462Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.131462Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0d227b0593d84d3d08c9bb3331fd64c3ba0ea23af07de4f1e1082970e2cc3abc","observation_id":"6b6846cd-bf47-4eb4-8db7-40c503b7c1e3","resolution":{"observed_at":"2026-08-03T13:22:13.131462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.221032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.221032Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c545a3fa09f1b9d7ab06a894f64557703310b97da0b2c3ca5c35e3729cf867b9","observation_id":"540c878a-3b0f-4679-b930-fbd5c2801678","resolution":{"observed_at":"2026-08-03T13:22:13.221032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.267737Z","title":"small\"ifsize_ratio < 0.01else","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.267737Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c2ac5f9b2764ff5210fa4c46f6be59fa6e72b3c816ea3affc9ca41c067365825","observation_id":"806563eb-1840-4fbb-8b28-9cef8c06c8b0","resolution":{"observed_at":"2026-08-03T13:22:13.267737Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.429051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.429051Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:79882438caa7d933ae54281f7b2ebaedebf5246b24371440ff8aac484565b6b1","observation_id":"ef0166ab-e496-4d55-88d5-ec756ac1c30e","resolution":{"observed_at":"2026-08-03T13:22:10.429051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T13:22:04.223484Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 4 inbound Pith citation observations for arXiv:2512.24561."}