{"as_of":"2026-08-21T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20628935065d8ce9ee21914722fb80ec89d2f568ab5c73f7029d27208588a961","coverage":[{"denominator":115,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:42:27.272900Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:13:17.389147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:53:04.514305Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2505.23766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23766","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Argus: Vision-centric reasoning with grounded chain-of-thought","venue":null,"work_id":"9c1ce74d-e001-4b31-959c-bcbfeee954f6","year":2025},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-08-15T02:04:16.167034Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2505.23766","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:1379d63a94cbb9e5d582ddc21503c44b57026a99f004a9f868f64f125555c9d0","observation_id":"eddf2992-4d4f-48c2-b205-5490f9d40a25","resolution":{"observed_at":"2026-05-20T05:53:04.515869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23766","snapshot_observed_at":"2026-07-31T16:13:17.389147Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-14T07:25:54.528363Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.389147Z"},"links":{"cited_paper":"/paper/2505.23766","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:36bcc287de3a82088aa87adbced2aa08d5646a3754b6718264e6909b8e489b47","observation_id":"05d5a947-1c4f-410d-a019-dc3e9c4702cf","resolution":{"observed_at":"2026-07-31T16:13:17.389147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23766/citation-record","integrity":"/paper/2505.23766/integrity","json":"/paper/2505.23766/citation-record.json","paper":"/paper/2505.23766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:42:19.402627Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.402627Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:45282dd3958ba2142cef067d91d6117c907fa2da4bb1df97847dd7666f1fffce","observation_id":"a72b6a48-f8a9-4501-a2b2-7024d85d6d1e","resolution":{"observed_at":"2026-08-07T12:42:19.402627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:42:19.444526Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.444526Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:37279fd702c0c56505ba20a3ae61d52359ca5ea61721abf81ce7005e79b83bce","observation_id":"75820004-30b7-44bf-9221-da447c4e1d07","resolution":{"observed_at":"2026-08-07T12:42:19.444526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:19.520327Z","title":"Graph of thoughts: Solving elab- orate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.520327Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:069b280fee99219d35200e7cceac7b03ce6807f79cf3914e971cd28d8ce945fd","observation_id":"88d3d0c0-a5ce-48c0-ae50-c739bfd28ae4","resolution":{"observed_at":"2026-08-07T12:42:19.520327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:19.601324Z","title":"COYO-700M: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.601324Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ee23dcadad40224939cbe9f3f65e8b24afeaed6dc978d9680b2c8d3effb7ac92","observation_id":"f7799f23-c9d2-4a05-b975-56c038072f1f","resolution":{"observed_at":"2026-08-07T12:42:19.601324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:19.671434Z","title":"Image- level or object-level? A tale of two resampling strategies for long-tailed detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.671434Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:48b3383f4f4c93affa7df68f8d517dd0ad313d37f01d6e3807f6d43b06091826","observation_id":"f6c99e94-eb56-490b-a4b2-d9495ed1b9ac","resolution":{"observed_at":"2026-08-07T12:42:19.671434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-18T15:05:50.204557Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-07T12:42:19.724749Z","title":"Contrastive lo- calized language-image pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.724749Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:d3c190ec1cd6c2049b4c9a69929324b4fb73a52566c41f79f99d6e5ae46647fe","observation_id":"10317e8e-dfcd-4da6-b919-f54e55f45b5d","resolution":{"observed_at":"2026-08-07T12:42:19.724749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T12:42:19.818075Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.818075Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ab0dbb44b83f4da47a0ac6d51bc66861c735bbc7e20cfc7afa09c6ba018a6b9f","observation_id":"8037f4c1-041c-4ee4-9d2b-f3a5b0f11ff6","resolution":{"observed_at":"2026-08-07T12:42:19.818075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T12:42:19.926696Z","title":"Shikra: Unleashing multi- modal LLM’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.926696Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:29e9fb7e8c16542c014b29562b27165da7c86354c9599f138680c6dc2faaf280","observation_id":"e2a95082-1f06-46d3-864b-a9c4f7776493","resolution":{"observed_at":"2026-08-07T12:42:19.926696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.016722Z","title":"ShareGPT4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.016722Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:027fbbaafaddbe96c0e48def63b4637db8379f789b7c6145a68142cc93cb67a0","observation_id":"3c50ad31-5af2-49ce-873c-eb9d295a5e35","resolution":{"observed_at":"2026-08-07T12:42:20.016722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.104403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.104403Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:d3ab89dd4439e90628cd45158753e1f709a2da0b65977ae569b3f3659a15b149","observation_id":"ca842615-03ed-4778-92f8-614556338954","resolution":{"observed_at":"2026-08-07T12:42:20.104403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.109699Z","title":"UNITER: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.109699Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:0609cfe6b82ac9c39067d488445333365de1b620a522be24a24035e7122e9ba2","observation_id":"59c73fe4-db18-43d4-abc6-fa74c5e38fe5","resolution":{"observed_at":"2026-08-07T12:42:20.109699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T12:42:20.115332Z","title":"How far are we to GPT- 4V? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.115332Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:e5193869ab5aa829a320280ba53758730b62e6cff5ffdeabeac633084f9ca572","observation_id":"1f6b802d-337e-4a18-94f6-af9cec44b46a","resolution":{"observed_at":"2026-08-07T12:42:20.115332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.167111Z","title":"InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.167111Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:18bfb78744e9e67a45d042e433c72d102a25f057df95c59c4a6cc840914132e1","observation_id":"956ba49b-7030-4de3-b51f-e8d1562315f1","resolution":{"observed_at":"2026-08-07T12:42:20.167111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.293659Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.293659Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:3852bc8427bb76a8fbf568be232d3a988da5e70f74bf37ca714016af237a6717","observation_id":"e1e539e5-bd04-4def-9e5e-f38af3bcbc95","resolution":{"observed_at":"2026-08-07T12:42:20.293659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.465076Z","title":"Control of goal- directed and stimulus-driven attention in the brain","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.465076Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:33e4c73efe926f9010dbf524d20de575ee2db7dcbd5f708b69d482f98d3eeb05","observation_id":"52568861-4eb7-452f-8468-df21945151b1","resolution":{"observed_at":"2026-08-07T12:42:20.465076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.584929Z","title":"TransVG: End-to-end visual grounding with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.584929Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:c612bc0f1595dcde26ce6025c549309960b9900bb4c498382efadcf89859fb94","observation_id":"c272db46-e74b-4272-b31b-8a95f9dc2881","resolution":{"observed_at":"2026-08-07T12:42:20.584929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.705927Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.705927Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f701b7499168e7417529b85e1e60c990179fdbf0be32ebf3a83125cf22c1523b","observation_id":"0d8760e3-a772-4ce9-8264-2ec9ae37c54f","resolution":{"observed_at":"2026-08-07T12:42:20.705927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:20.838022Z","title":"EV A: Exploring the limits of masked visual represen- tation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:20.838022Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8c39b1ab5b586484c1d8d7d6d2100add616d4e8df23ac4e6912d5c56b3bd4ce0","observation_id":"f6163e6c-4dc8-4608-8eb2-4c3cd09f1bca","resolution":{"observed_at":"2026-08-07T12:42:20.838022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.037629Z","title":"EV A-02: A visual representa- tion for neon genesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.037629Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:3b13683313f8c5af82a6ac75b4379ecd9940bf5ebcbefc1e6d10227b7469a20d","observation_id":"7c022133-ab69-429a-8f09-0e77fde0f459","resolution":{"observed_at":"2026-08-07T12:42:21.037629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.222589Z","title":"Large-scale adversarial training for vision-and-language representation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.222589Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8637977e3702a3682ef5a11d6febb952b823989870fdf4141d5c7e4f73b14ffb","observation_id":"615865d7-9138-4cfe-9a17-53b48207f9f1","resolution":{"observed_at":"2026-08-07T12:42:21.222589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-19T23:16:39.427866Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-08-07T12:42:21.316826Z","title":"G-LLaV A: Solving ge- ometric problem with multi-modal large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.316826Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:5e96e2a5fe1fd99e5b0b56c5c863bdf17961ebe82a4290a53df37605bca91e0b","observation_id":"2667aa1f-2260-41a4-987a-8af23b0a4900","resolution":{"observed_at":"2026-08-07T12:42:21.316826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.428454Z","title":"Mini-InternVL: a flexible-transfer pocket multi-modal model with 5% parameters and 90% perfor- mance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.428454Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8c02ccf5e71b049e842fe9a7e95067a412af0cac2b91d51ad6f9e2c3640ad776","observation_id":"a31c67fc-e199-477a-b0d8-47605887f98b","resolution":{"observed_at":"2026-08-07T12:42:21.428454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07919","last_updated":"2023-06-17T06:40:27Z","snapshot_observed_at":"2026-08-18T10:10:16.111731Z","submitted_at":"2023-04-16T23:59:25Z","title":"Chain of Thought Prompt Tuning in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07919","snapshot_observed_at":"2026-08-07T12:42:21.531787Z","title":"Chain of thought prompt tuning in vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.531787Z"},"links":{"cited_paper":"/paper/2304.07919","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:1cb9dff14cc704ecfc5edf1227f13545e328ddb1ae97fa4d55dd57f870f61a76","observation_id":"eacfc6a9-284e-4cb0-985e-91ae207c9166","resolution":{"observed_at":"2026-08-07T12:42:21.531787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.668887Z","title":"ICDAR2019 competition on scanned receipt ocr and information extrac- tion","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.668887Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:427109f30ab531643cfdc29adc04ab88da4b65900e0155b64ef27f433274ecc5","observation_id":"7cbf3642-e9bd-4ae4-acc9-f3748b916f3f","resolution":{"observed_at":"2026-08-07T12:42:21.668887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.749739Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.749739Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:e3912fa04f6fdd334a6d4cae6f80dcc92eb69134695ea547bf6452caed8e8d5e","observation_id":"349adb94-1f6a-424f-9076-136c1a00cd06","resolution":{"observed_at":"2026-08-07T12:42:21.749739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.843798Z","title":"Psychology, briefer course","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.843798Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7c66e8cf3bda98c15db615f22ed375e6a5c0e8fc0ada17f4d313628947286675","observation_id":"e254aacd-fa5a-4c7b-b740-0849780bae51","resolution":{"observed_at":"2026-08-07T12:42:21.843798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.910492Z","title":"DVQA: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.910492Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8a294793d1f590fc70b6b5854fbf387995baab1cd003cd3488c0d80c646dc31d","observation_id":"59bd9f19-fe59-477f-98c5-76be3a9913a1","resolution":{"observed_at":"2026-08-07T12:42:21.910492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:21.952695Z","title":"MDETR- modulated detection for end-to-end multi-modal under- standing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.952695Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ae91cda67c358c3f91a45969b0d72f5cc5fe8d4c98fdba04b40d23f0ba07daa3","observation_id":"d1a4c098-ce32-427b-ba92-0ce4f6a87e66","resolution":{"observed_at":"2026-08-07T12:42:21.952695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09217","last_updated":"2020-02-19T15:51:25Z","snapshot_observed_at":"2026-08-20T03:31:19.413704Z","submitted_at":"2019-10-21T09:03:19Z","title":"Decoupling Representation and Classifier for Long-Tailed Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09217","snapshot_observed_at":"2026-08-07T12:42:21.977055Z","title":"De- coupling representation and classifier for long-tailed recog- nition","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:21.977055Z"},"links":{"cited_paper":"/paper/1910.09217","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:15d5e237979f4b8c7c9b19ed025231dcc2a2b9b2a39128aa28ee7cd68e7fa859","observation_id":"2e7df115-ee58-40b9-a260-a522e72ad03e","resolution":{"observed_at":"2026-08-07T12:42:21.977055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.022331Z","title":"Directed attention as a common resource for executive functioning and self- regulation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.022331Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7d052d2ca6f0e2855d2d00a9101cd20610c089ec4da44eb44042d733c264f3bf","observation_id":"d7114c00-4945-4a02-96f2-1a02a098d026","resolution":{"observed_at":"2026-08-07T12:42:22.022331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.115768Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.115768Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:bb143455a0aef66cd7fd38de9b02f90d8fba3c7e8b2dcc8bf6786332255177dd","observation_id":"2317f3f8-8bfb-4905-9e93-18f907f9a5eb","resolution":{"observed_at":"2026-08-07T12:42:22.115768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.148962Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.148962Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:4e5c3ba6d4704a4b7aaebfbfb21cc8646953d58ccad3f9be1b1d6735448214ba","observation_id":"f1c4ba91-1f06-4c86-8008-525781db0295","resolution":{"observed_at":"2026-08-07T12:42:22.148962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.220749Z","title":"Ocr- free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.220749Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:bdb1dd72169c7781f4c23b5e474a2257edd331d308e7cc9b66ca92a88f701bb6","observation_id":"4cbfbb20-ff0e-437a-9603-3f7049fb3901","resolution":{"observed_at":"2026-08-07T12:42:22.220749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T12:42:22.248371Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.248371Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:b9cf057e6f325f3bfdbacb88f0fbc284dd4f306e959e624b07c68114e1b8fad3","observation_id":"88ee7489-05f8-4daf-85be-fc395c2396bc","resolution":{"observed_at":"2026-08-07T12:42:22.248371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.283486Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.283486Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:5d551ce4d014f8203273e46d81a05ea01f7a044f7e175437c9ee3f33ba0a14cd","observation_id":"be2f570d-589b-47ab-87a7-20bf277d305e","resolution":{"observed_at":"2026-08-07T12:42:22.283486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.340938Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.340938Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:9421374d4abe58fd313dd8be09b46cd6ea60eef4c9c07d7c86b43320da39a403","observation_id":"ac1fb692-0ba8-46cd-a09f-f0c988b4a917","resolution":{"observed_at":"2026-08-07T12:42:22.340938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.399259Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.399259Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:b9c4ad806372035fce1553f9e27a909599a362909bfec93324193b9668418f8a","observation_id":"20799561-2b25-4297-b774-f23b9046f6e8","resolution":{"observed_at":"2026-08-07T12:42:22.399259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.482501Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.482501Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:2cf494ce35946a998e51c20b7e0b7d88145a7c5e5393b0ffae90495ca70bbe54","observation_id":"e8b71fcb-f634-4abe-9d32-6391b8908497","resolution":{"observed_at":"2026-08-07T12:42:22.482501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:42:22.562053Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.562053Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:007aa8725628e17f043c7aac3af63919dc87d6c45075ad4da1686a5fc0f42f59","observation_id":"beb28aa1-9a29-4ccd-bda1-e105f543785c","resolution":{"observed_at":"2026-08-07T12:42:22.562053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.626506Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.626506Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:94ef2258ef00ed822da62bf06874b07e4b24bf89a2e33747063f70077d886dfe","observation_id":"0bccfa64-bd9d-4c4d-b3c9-a6d40fb91001","resolution":{"observed_at":"2026-08-07T12:42:22.626506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T12:42:22.713377Z","title":"Mini-Gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.713377Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:325afb0a9fc8eb529f9077d5c411ce1e628e987fe8014d0abba40a5c5d740bba","observation_id":"efb08d6d-60ba-44cf-83e0-3faa755e423b","resolution":{"observed_at":"2026-08-07T12:42:22.713377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16919","last_updated":"2025-03-08T17:16:09Z","snapshot_observed_at":"2026-08-17T14:05:00.449649Z","submitted_at":"2024-05-27T08:12:00Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16919","snapshot_observed_at":"2026-08-07T12:42:22.824876Z","title":"V oCoT: Unleashing visually grounded multi-step reasoning in large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.824876Z"},"links":{"cited_paper":"/paper/2405.16919","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:e167a55df644f4defec15f151f3aabb2692e038e32e6c677107d61ac8dc3322f","observation_id":"da18befe-f9d2-4dc4-933e-62124fd12f8a","resolution":{"observed_at":"2026-08-07T12:42:22.824876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:22.868037Z","title":"VILA: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:22.868037Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:a2276880f6f913300af1bc07ab2873191d3d4d328e6f847d66704d2ec355cc1d","observation_id":"c23829ac-dcf1-4951-aabf-44575069f9ae","resolution":{"observed_at":"2026-08-07T12:42:22.868037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:23.031778Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.031778Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ba208d981c818ad094026dbd41b9d105da85d6aae877f9bfbb0783c46d043078","observation_id":"4c2a42b3-93f0-4925-a7fc-4999f7603b01","resolution":{"observed_at":"2026-08-07T12:42:23.031778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-07T12:42:23.171837Z","title":"SPHINX: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.171837Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:50066eea8eb6f090d39cbe4a8aaba6bd75abd169320824f6c144c9919a19f05f","observation_id":"df271657-5cac-4b63-a74f-8e561cc63d9b","resolution":{"observed_at":"2026-08-07T12:42:23.171837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:23.295233Z","title":"Visual spa- tial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.295233Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:deeb073bb5ad9501ea5f79ec62604c694d238e8be05f15a68ed8f9346fe3ceb6","observation_id":"6418badd-317f-4b71-8068-579b8eb9ca8f","resolution":{"observed_at":"2026-08-07T12:42:23.295233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T12:42:23.389391Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.389391Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ceec3132e938c225daa43ef721a7f5c76aa6bbcadc4536326910483ae39c9bbf","observation_id":"1105ceec-6b3c-40ec-9ba3-f1d9f73e1d1c","resolution":{"observed_at":"2026-08-07T12:42:23.389391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:23.469711Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.469711Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:e22c0f5e7d3012afabffcc7f4007d2ffb374971d1c5aa5364f671a22f7731cd0","observation_id":"a30631d2-320c-440b-b3d4-c8afdfdd5783","resolution":{"observed_at":"2026-08-07T12:42:23.469711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:23.492051Z","title":"LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.492051Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:4615707358846e5954864e1620ff9fc8f67697274fe39076c059ac174e463f68","observation_id":"1b34ff84-c214-423f-99b7-1a56fe1ad065","resolution":{"observed_at":"2026-08-07T12:42:23.492051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-08-17T09:14:08.623745Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T12:42:23.566141Z","title":"LLaV A-Plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.566141Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:93f759342b4b8ad21d1e5f1ebb1b550282f3812bcef60eca715dec057995114f","observation_id":"5d56ce10-92a8-4789-9fc0-94d03b860da1","resolution":{"observed_at":"2026-08-07T12:42:23.566141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:23.622303Z","title":"Grounding DINO: Mar- rying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.622303Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:24ec3168d4b2be04a939c9abcb5c5cf3b42339d57b45afd7a9450368b691411a","observation_id":"5881f90f-c286-468e-8949-1e900d4945f1","resolution":{"observed_at":"2026-08-07T12:42:23.622303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.714115Z","title":"A convnet for the 2020s","venue":null,"work_id":"654d9b8f-68cf-4077-8857-e21e91d24a4b","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.712415Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:a5d702b250547b3488f1f59e7ca656262a036feda2dd0c0f8dd0fab69849aa4e","observation_id":"68e27013-fe4f-4292-a61f-e1f0ecc6adf3","resolution":{"observed_at":"2026-08-07T12:42:34.816112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:42:23.786924Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.786924Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:580e4dc020e48aebb7fa16699952f10f08929ae0295ccb2a9c14f6b97b67de56","observation_id":"f78a3c10-f95f-446a-869e-285295b71a53","resolution":{"observed_at":"2026-08-07T12:42:23.786924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.581361Z","title":"Learn to explain: Multimodal reason- ing via thought chains for science question answering","venue":null,"work_id":"cde65283-a5b7-42cf-a86a-44bfd1d885f7","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.819892Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:aa9f71cda741937ce2b5bc1b0093595885804c8ced6547bc89e87000391bd61e","observation_id":"cfbf9480-8d1b-454e-8066-530f202a7d25","resolution":{"observed_at":"2026-08-07T12:42:34.629037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.494027Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"716862fd-0a78-487d-bca9-ab17f23919c0","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.845864Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7acde175c5009ae16c03de1fe4f5adc1970b667d035a8f1fa4db631c74d7453e","observation_id":"4c01eca9-412f-40f5-8081-685f8a7bf18e","resolution":{"observed_at":"2026-08-07T12:42:34.541033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.336132Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"65f3e778-21f4-4f5e-b940-6c9cffaef9f8","year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.869082Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:9b3010a8e165000800ecd9634d9beac50a6ee58a521ef5807be190503a4af478","observation_id":"4fb2db53-8f1c-44a6-9601-86d9b8792018","resolution":{"observed_at":"2026-08-07T12:42:34.411493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.264082Z","title":"Infographicvqa","venue":null,"work_id":"f2bb32ea-42b3-476a-9922-17d5aa19eee0","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.903360Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:95cbf7d76be12dd1386688cc2ddde838681c5b88853a45dd0abe1ee10a8b0623","observation_id":"1a5fcb9f-4b0d-46a9-a983-818e9656c63e","resolution":{"observed_at":"2026-08-07T12:42:34.312367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-07T12:42:23.938819Z","title":"MM1: Methods, analysis & insights from multi- modal LLM pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.938819Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:0857408fe054e76ed77a10cde02e33fa22f27ee6378fd31f61e49623458bbdff","observation_id":"d246c863-0a36-4ae5-a52f-ff926dd5d1d1","resolution":{"observed_at":"2026-08-07T12:42:23.938819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.200843Z","title":"Architecture of connectivity within a cingulo- fronto-parietal neurocognitive network for directed atten- tion","venue":null,"work_id":"18173f54-555c-4128-b2d6-fad39c7a1fe3","year":1993},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.992739Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:6f0ad6b7b08f4013c7edbacc3acf4a79a38fa998cdfffeea269370002c2468a3","observation_id":"714df9be-92dc-4ca0-ad9b-584038d7a9eb","resolution":{"observed_at":"2026-08-07T12:42:34.232482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.134952Z","title":"Brain mechanisms for directed at- tention","venue":null,"work_id":"c5371784-41a9-4d68-8ad1-481b18136b7e","year":1978},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.170796Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ff7f68e9f462fd04cb392d3f088dd93be18fee4c89eebfadf47c037a4715e535","observation_id":"2f6a914f-6e71-47db-b797-ef96405b1561","resolution":{"observed_at":"2026-08-07T12:42:34.164846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03321","last_updated":"2024-10-04T11:18:41Z","snapshot_observed_at":"2026-08-16T13:12:38.237340Z","submitted_at":"2024-10-04T11:18:41Z","title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03321","snapshot_observed_at":"2026-08-07T12:42:24.327499Z","title":"Visual-O1: Understanding ambiguous instructions via multi-modal multi-turn chain-of-thoughts reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.327499Z"},"links":{"cited_paper":"/paper/2410.03321","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:94bb61d468b5541cf46690df461636b3db8413952fcb52e7bbd1a0f639d5075f","observation_id":"319f97d0-691f-45aa-bcb7-0271ddc1840b","resolution":{"observed_at":"2026-08-07T12:42:24.327499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:34.083679Z","title":null,"venue":null,"work_id":"e4a90600-4133-40ff-8f59-b420224ba1b6","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.467862Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f515eff529768b5483061f8a5f3e89a29a83aa36356b6cdf4671a69b9092fbf4","observation_id":"b35e0369-055f-4f67-8cfb-a770b12e8cf8","resolution":{"observed_at":"2026-08-07T12:42:34.102582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:42:24.586170Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.586170Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:4d1a0cff8a7d7fa58778d6d7ad0a6746508df3b1afbbdde325a12e65242e4bf9","observation_id":"927cd690-da00-4c1e-b525-7f40f5ab09fb","resolution":{"observed_at":"2026-08-07T12:42:24.586170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:24.625803Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.625803Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:5baaade37d6221e0e7049ee61523eb6f0a87bf44dd16ffdffee464494e90610d","observation_id":"bb0ab443-ea3c-4c00-9353-97ead8d5b112","resolution":{"observed_at":"2026-08-07T12:42:24.625803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.962558Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5b6bd120-36ac-4688-9394-ad1876f4a213","year":2021},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.723342Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:959386e711141b24bf6e386c9d11befee6f6d2a38dcf0be048bfa02783e3b458","observation_id":"6646bc2c-a9cc-4453-be73-5dbe9baa0669","resolution":{"observed_at":"2026-08-07T12:42:34.016050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.834321Z","title":"GLaMM: Pixel grounding large multimodal model","venue":null,"work_id":"868f85e7-482f-43a7-8065-cfcb12328d9c","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.748882Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f311d271e981a5ce26b01f4ee5fe4e54dff52d3bdb383f4aa7c16a86dc1a6429","observation_id":"01b6529b-ebe6-4211-ab78-517f32154a43","resolution":{"observed_at":"2026-08-07T12:42:33.902621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-18T15:29:02.493000Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-07T12:42:24.889360Z","title":"Grounding DINO 1.5: Advance the edge of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.889360Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:efe067fb1f289e42f0754143470a8f4b4ec3a6f38ec5755f8ed3972863683fa3","observation_id":"8a1d9953-bb8d-4e1c-8889-22809e5d3b91","resolution":{"observed_at":"2026-08-07T12:42:24.889360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:24.956553Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:24.956553Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:598f7778f3dcebf8847d4d461de1b14da5ab5f1a8f7a60ed8cb87933e0528793","observation_id":"9a36ff0b-81f0-473e-9ef7-dac2d0e3d4f0","resolution":{"observed_at":"2026-08-07T12:42:24.956553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-08-19T21:30:24.332188Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T12:42:25.021502Z","title":"Visual chain of thought: bridging logical gaps with multimodal infill- ings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.021502Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:bf2f51d7a4b2fe646b0c54cdb2f8aff8167098e39108e03ee94b24b8594193b1","observation_id":"991f54e3-8231-4670-bdee-c8beff1d6ab8","resolution":{"observed_at":"2026-08-07T12:42:25.021502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.725168Z","title":"Vi- sual CoT: advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"fed1f442-b6e1-4b76-b4fc-af8942b7acc8","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.111107Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f77fdd9a5d425e05562942ef69ddd6b435ed5bd1a1b033d9597096c3a337ea20","observation_id":"32bec0cb-17a0-4933-a838-d9f1587817d4","resolution":{"observed_at":"2026-08-07T12:42:33.773354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.505643Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"1884a485-bbcd-4b8a-8e2b-c373ca6ee1ce","year":2019},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.224907Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:10bd118d182733d1631e03aa7f1153f1dcb3aa5a550f21a0b7eb3491651e5187","observation_id":"8ec44b3f-8926-450d-9f08-f198168a8025","resolution":{"observed_at":"2026-08-07T12:42:33.613986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.291819Z","title":"Eagle: Explor- ing the design space for multimodal llms with mixture of encoders","venue":null,"work_id":"2e0e0210-af80-45df-adf9-d37ee92d3ea5","year":2025},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.314795Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:bded1dae8788b07801886d3378e4f1cf21d6b66b344bc7ae45d45ec0ce0f9132","observation_id":"554fe99f-b054-4dac-98e2-9f52f98d8e3d","resolution":{"observed_at":"2026-08-07T12:42:33.385784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:33.117027Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":"ab1bc9a5-c293-462c-aa8b-6d8400f7d325","year":2020},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.373716Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:fa2c597327eae26d4e317bd4ac809c4aa925a8269791e5c3999f8a9f7a0a2b7d","observation_id":"ed165910-6713-4ec8-b29f-a8ee59c38191","resolution":{"observed_at":"2026-08-07T12:42:33.205047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:25.446368Z","title":"Towards VQA models that can read","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.446368Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:adee38cea92d5efca4e0fffca0ddd7419f83a1161fda867f6ffb58c244ccaf16","observation_id":"fb5507e2-77f1-465b-8f74-419354a6b629","resolution":{"observed_at":"2026-08-07T12:42:25.446368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.918837Z","title":"Introducing the next generation of claude,","venue":null,"work_id":"7817a65f-931c-430b-8bd0-d1463aaa0708","year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.485107Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:2f96e1984c4c7facf4b0046703385e8118bd9f197fc2f3c2b9e882fccf07c416","observation_id":"fcb1b8ea-d531-4f39-b438-6939dc318e59","resolution":{"observed_at":"2026-08-07T12:42:33.000409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T12:42:25.628926Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.628926Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7345225ed32a994a289ca18cdae36f69e39df485a884dbea074a54ad9ce2ce66","observation_id":"c5aea925-1146-484b-92a4-af1f85ab80a0","resolution":{"observed_at":"2026-08-07T12:42:25.628926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:42:25.735873Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.735873Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:3b93a8a44d06ad30428ea3f09f31a9b967ae960e0ffbc64a90953af6110dd858","observation_id":"e59f55fe-a678-4f02-839e-bc218451dfd3","resolution":{"observed_at":"2026-08-07T12:42:25.735873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:42:25.785902Z","title":"Gemini: A family of highly capable multi- modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.785902Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:6804d93c93f0966d5f0364835bde1b37220254a744b8e6d1ce57747ff5018b6a","observation_id":"c1285999-0075-4185-9bd3-00990715af43","resolution":{"observed_at":"2026-08-07T12:42:25.785902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:42:25.842990Z","title":"Gemini 1.5: Unlocking multimodal un- derstanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.842990Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:2ebee1927d4b7892c29ba292bd8d6fb634000fa68b1f9dec2c61f70e78a40d62","observation_id":"91279993-fbe2-4d3b-9699-8735a99f17dc","resolution":{"observed_at":"2026-08-07T12:42:25.842990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.743330Z","title":"Laion-gpt4v dataset, 2023","venue":null,"work_id":"0938343c-089d-48f8-8ab7-7948357fd612","year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.885829Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8b773ba4ac74d829247a982d09ebd87023473887c6f003769413991d917d18de","observation_id":"485ae442-cff4-4a08-9f52-2f58ad1cbb9e","resolution":{"observed_at":"2026-08-07T12:42:32.814620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:42:25.906540Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.906540Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:87447a02e53bec9bf870b81587514cb6388a67f78967f00d6601efdba4ffdfea","observation_id":"e16d7b99-ff67-4eea-b2f3-cdf8f51790c2","resolution":{"observed_at":"2026-08-07T12:42:25.906540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:42:25.951435Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.951435Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:a64267e73e71dc5f5a29bd06543acb248fe9216277f0c2d551fe8dcc81c2345b","observation_id":"a0ce2099-2d64-44d9-9eb9-34ae8cc575df","resolution":{"observed_at":"2026-08-07T12:42:25.951435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.679969Z","title":"InternVL2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy,","venue":null,"work_id":"c06a0470-77f5-4201-a88e-ef41c21e1eeb","year":null},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.014272Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:1e25cc6a500f261a3d46ab7992d2a31382b91edba24caf63f3f7d33b80901417","observation_id":"a0259e96-31a0-4aa4-98b2-17eb04358c28","resolution":{"observed_at":"2026-08-07T12:42:32.700118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.599781Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants., 2023","venue":null,"work_id":"cfd93dc6-d553-40ac-b6cb-35c6b81b2ca3","year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.107864Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:d7d9c5e6404b166e983a35ba6c32b0b8aa472a98b5b55939599b9de5ed4a0a13","observation_id":"4ffdfbc1-cc0d-449e-9556-2dfa81042bec","resolution":{"observed_at":"2026-08-07T12:42:32.638127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T12:42:26.229952Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.229952Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f63b29b93119e1a2245b3f45da148e87629d29c748b128dd5b6b83ff6774e851","observation_id":"b54b13ef-7543-4d9b-bc37-a5b6a7637745","resolution":{"observed_at":"2026-08-07T12:42:26.229952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.512253Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal LLMs","venue":null,"work_id":"dc65bb7b-899a-4679-8df7-749a52865c66","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.323211Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ad28e55b542f9197720e449b984170f102a1a5ec2ad8bd49159d89cb94ca1310","observation_id":"2eb15478-74b7-4f6c-9893-7cbd6890e848","resolution":{"observed_at":"2026-08-07T12:42:32.551567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.353013Z","title":"Document understanding dataset and evalu- ation (dude)","venue":null,"work_id":"39cd1542-21df-4dc1-b49d-60e9e7133f68","year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.400879Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:ed6011983004eb37f3cc8d92cc5f8965e8390e4bb8ee84a82e56f371ce198883","observation_id":"d7487d99-fe6f-4567-ab66-d45c5826f27a","resolution":{"observed_at":"2026-08-07T12:42:32.424203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.208501Z","title":null,"venue":null,"work_id":"3c996de0-0a6d-407c-9d4b-abea465fbd9c","year":2011},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.469873Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f13578fbff8344a73fc3a072307df6773b8616f0f362ff8894be29b9286ac728","observation_id":"d43d6722-028f-4a63-ac3c-fb3f92504af4","resolution":{"observed_at":"2026-08-07T12:42:32.278977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-19T19:09:57.209068Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T12:42:26.521528Z","title":"To see is to believe: Prompting GPT-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.521528Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:12355f047f3e9963c4c3a7348631c4015cc6635869eefc03d5c8a8e0c193d6f0","observation_id":"1df6994e-e983-4736-9c96-d1dc5913f244","resolution":{"observed_at":"2026-08-07T12:42:26.521528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:32.047907Z","title":"OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"106fafc2-a72e-4ec1-8f47-d99ff95964dd","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.602116Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:2aa445326755e08e0cae2fe241d076f069023cac08d99c143a6999c0acbb966d","observation_id":"d422d969-7941-489f-8f72-e2db29a34e9f","resolution":{"observed_at":"2026-08-07T12:42:32.123230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:42:26.691696Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.691696Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:afaee309b76b3aae7bef7968965a4456dc4a8e24693cadbe1a89f7dec0747894","observation_id":"15d4a4c7-fcf2-4843-b34e-87dac03b76f4","resolution":{"observed_at":"2026-08-07T12:42:26.691696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T12:42:26.766875Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.766875Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:91e5a246acf37aa4252de33fe382b4da18ea15a8e70eb9d80601ed9581f09841","observation_id":"0f4a3485-343b-4250-bec0-8da2edfa7963","resolution":{"observed_at":"2026-08-07T12:42:26.766875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:31.774071Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":"ba9e8f27-662b-406d-b02f-dcd71203a723","year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.832054Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:54cea03476b1e519a8cd34f09d71b5cc61d786000e41ca86358d95c37550434f","observation_id":"64d80b74-8151-4e78-ba1d-196f8aabaee6","resolution":{"observed_at":"2026-08-07T12:42:31.898779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:31.581856Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"fae2c884-2157-441c-878d-ee1763001401","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:26.934159Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:cdbf52799bca75a10605a4c6278380086222d851c46cc9d511a09619be0a924d","observation_id":"81064563-fd71-4858-882d-0404f0a59923","resolution":{"observed_at":"2026-08-07T12:42:31.628673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-07T12:42:27.031748Z","title":"Visual ChatGPT: Talking, drawing and editing with visual foundation mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.031748Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7d7c2c4032844ab6a4a754ed36998fc9f41d6e86934cc610f1413d8fa7cc2c6d","observation_id":"d4241a76-04df-4c98-be96-d1a6782c228f","resolution":{"observed_at":"2026-08-07T12:42:27.031748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:31.418838Z","title":"V*: Guided visual search as a core mechanism in multimodal LLMs","venue":null,"work_id":"ef0e8c87-7749-4147-b0ea-dba54fca713c","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.074230Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:8e5d65db931277a46aaaa46c0bf11e024e7007044f82dcb6b953c1ec2d7ae61a","observation_id":"3a433373-0949-424f-8f61-013d8088efda","resolution":{"observed_at":"2026-08-07T12:42:31.492476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:31.289733Z","title":"Grok, 2024","venue":null,"work_id":"13d0572a-9c59-40d2-abdc-4ebd1fc530ef","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.113583Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:680b19cdcf8064815c04b8f2bb8770959f476c8a03e107c051737e5140ae07c4","observation_id":"14542e57-6b1b-4716-baf2-fca9bf3c314e","resolution":{"observed_at":"2026-08-07T12:42:31.326043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:31.165627Z","title":"Florence-2: Advancing a unified representation for a va- riety of vision tasks","venue":null,"work_id":"d46e97c2-1635-4a21-9ad7-2ce0e41aa17a","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.156407Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:06a77ee464878ecf2726f686dc3b21b9fe183d2593f3a692a1533a1f4acc46fa","observation_id":"8cfba54f-0f0b-4c89-bef2-f1b4974ecdf7","resolution":{"observed_at":"2026-08-07T12:42:31.210669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:30.925239Z","title":"Denoising vision trans- formers","venue":null,"work_id":"5888cd76-a95f-4989-9bd6-707129acfd99","year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.195113Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7452309be185f786bf8a6807e58b5a80dbe21b6d87256b5abd40f3a717d71bba","observation_id":"9a22ca37-65b7-40f7-a567-2579d68079d0","resolution":{"observed_at":"2026-08-07T12:42:31.042066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:42:30.823668Z","title":"UniTAB: Unifying text and box outputs for grounded vision-language modeling","venue":null,"work_id":"60f4ef16-cd6f-49a9-918c-c024ee423ba6","year":2022},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.272900Z"},"links":{"citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:f2fcc84ef2cab9f4305d0b2e38d8a0ad484fe03fd4ff1b81f5b501f200524e5d","observation_id":"a1a23623-bcb0-4da3-874e-c340119c1c88","resolution":{"observed_at":"2026-08-07T12:42:30.851692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T12:59:59.091660Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":115},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 115 outbound references and 2 inbound Pith citation observations for arXiv:2505.23766."}