{"as_of":"2026-08-20T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2ac69e01601ac013fdf4891d2033e935a2fdc76ae17a4f88ffe162c224ff209","coverage":[{"denominator":107,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:19:33.933240Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:09:18.613268Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:04:26.359777Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-15T20:50:47.703948Z","title":"Chatrex: Taming multimodal llm for joint perception and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11852","last_updated":"2025-05-17T05:31:17Z","snapshot_observed_at":"2026-08-18T19:40:51.771714Z","submitted_at":"2025-05-17T05:31:17Z","title":"MedSG-Bench: A Benchmark for Medical Image Sequences Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:50:47.703948Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2505.11852"},"observation_digest":"sha256:1a1ccc9b513712564a631c47220c8b429ca92ef0b8de93a7579aacce9523584a","observation_id":"66437ede-5786-4b06-80fd-7bf12bb9742e","resolution":{"observed_at":"2026-08-15T20:50:47.703948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-07T10:55:14.691428Z","title":"Chatrex: Taming multimodal llm for joint perception and understanding.arXiv preprint arXiv:2411.18363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-16T17:02:27.821392Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.691428Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:041c44df4b3e2b689914111a5b53434506c13f3bd62b905e35e5908502da7f56","observation_id":"c9de07c2-fa78-4dac-b2cb-26ffb269408d","resolution":{"observed_at":"2026-08-07T10:55:14.691428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-07T10:28:10.735473Z","title":"Chatrex: Taming multimodal llm for joint perception and understanding.arXiv preprint arXiv:2411.18363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-17T14:19:05.417280Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:10.735473Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2506.05302"},"observation_digest":"sha256:c32e6bef1e5f681b1886b193fe9e78b20c981e9961e964f3b498b3ff5353e831","observation_id":"7e4fafc4-c40b-4f2c-abba-fae1b630d798","resolution":{"observed_at":"2026-08-07T10:28:10.735473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-03T18:15:05.207146Z","title":"Chatrex: Tam- ing multimodal llm for joint perception and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-15T01:13:36.123242Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.207146Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:624859e4a93ba011d4aea7af00380516b5837f8eb6b8449114afd68c9b2e1c83","observation_id":"21bcd62c-d96f-4fc7-a957-29b10de5adb9","resolution":{"observed_at":"2026-08-03T18:15:05.207146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-08-11T12:33:58.665102Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:cae1af04146b3e5ee817407a2ad28e86140fee75026fa39b68aad2806a232064","observation_id":"0a4bef3e-e2f9-4880-8b30-7aaf303fa134","resolution":{"observed_at":"2026-05-16T23:31:21.894977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2604.24036","last_updated":"2026-04-29T06:30:21Z","snapshot_observed_at":"2026-08-18T12:27:44.825732Z","submitted_at":"2026-04-27T04:42:03Z","title":"Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:38:06.673737Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2604.24036"},"observation_digest":"sha256:fea7cf86d31db8829a9bda14a11b9617e423cd9273bc006a25894f24698666bc","observation_id":"c0b42aca-156c-4d4e-a81d-bc1744630647","resolution":{"observed_at":"2026-05-11T21:41:15.238967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2605.14923","last_updated":"2026-05-14T14:58:46Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:58:46Z","title":"SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T20:51:56.131205Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2605.14923"},"observation_digest":"sha256:84f5370f96c88227ec6e19333f3286e127eba635165da930ed5d3c556d16bd19","observation_id":"91885753-a2b4-495b-87a1-4de3389b2bfd","resolution":{"observed_at":"2026-06-30T20:55:04.148592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-17T15:34:17.600386Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:c660cc0e74b6145156a7a3bede6acdfd48a0f513511e598d41e9a1b42854f367","observation_id":"c321b45e-0f05-445c-9f31-6e0f27040570","resolution":{"observed_at":"2026-07-04T15:09:55.232665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2606.28862","last_updated":"2026-07-05T22:18:45Z","snapshot_observed_at":"2026-08-18T13:51:03.891802Z","submitted_at":"2026-06-27T11:10:33Z","title":"HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-30T10:01:31.638894Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2606.28862"},"observation_digest":"sha256:2c0ea580cb9aea03029aec234dfc24b4f65fd25c1823690a27eb91db694b98a0","observation_id":"0ac54816-6a0b-4701-8b6b-f8cd2e3ab968","resolution":{"observed_at":"2026-06-30T10:04:35.951457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-08-15T08:35:30.089617Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:8418eb39c3fbed9653c09ab84d61a97a16105fbf33ddbcdcc3a4bae6870b99d0","observation_id":"bd0898ff-794f-494b-91c6-da4a1dec1311","resolution":{"observed_at":"2026-07-08T02:04:26.361272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-01T20:21:03.797710Z","title":"Chatrex: Taming multimodal llm for joint perception and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16671","last_updated":"2026-07-18T06:59:08Z","snapshot_observed_at":"2026-08-14T18:48:57.403395Z","submitted_at":"2026-07-18T06:59:08Z","title":"Foundation-Assisted Active Learning for Object Detection Annotation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:21:03.797710Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2607.16671"},"observation_digest":"sha256:7d48bda22a88d5ed9b3fc2a2e25c7a6def4aa84e224078a1fe838a85d3528ce1","observation_id":"e0c9b431-5f79-46fc-9a18-833a08027fef","resolution":{"observed_at":"2026-08-01T20:21:03.797710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-01T11:00:26.098703Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20061","last_updated":"2026-07-22T12:05:13Z","snapshot_observed_at":"2026-08-19T19:12:48.727039Z","submitted_at":"2026-07-22T12:05:13Z","title":"ReferTrack: Referring Then Tracking for Embodied Visual Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:00:26.098703Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2607.20061"},"observation_digest":"sha256:f480e7733caea8af300fef24fd9cb2c9409ed23bb5328ef5dbad9600d8bcdcc5","observation_id":"66d972d2-c497-4c56-b402-548652603d6c","resolution":{"observed_at":"2026-08-01T11:00:26.098703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-16T00:09:18.613268Z","title":"arXiv preprint arXiv:2411.18363 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-18T14:54:50.007162Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.613268Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:8ba8074bc80a4cdea414f34e47f3f42af8b34fb61a0cf8584995e9865a0eb6db","observation_id":"df1f35da-7181-45c1-9d20-854025286865","resolution":{"observed_at":"2026-08-16T00:09:18.613268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18363/citation-record","integrity":"/paper/2411.18363/integrity","json":"/paper/2411.18363/citation-record.json","paper":"/paper/2411.18363"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T11:19:33.395298Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.395298Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:06f4958c2807a62b6ddb8e3c01789f81ed18fb4d96476b4fe3d9b50e7893218d","observation_id":"9c49a763-780b-45de-b3ad-724e2f0244e5","resolution":{"observed_at":"2026-08-12T11:19:33.395298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T11:19:33.402612Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.402612Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:d088fe81a4935a6c8feee8a481fdb5a5b6c4d0a59831cc0eeedbc182881d4a76","observation_id":"a70a0432-8b30-45e4-a6bf-1d5a78d5c38d","resolution":{"observed_at":"2026-08-12T11:19:33.402612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T11:19:33.407841Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.407841Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:b43db53bf5251f3c3499685e5bc7f1f0a0109b17910a469de2c922bef9ce9e84","observation_id":"32836d25-12f2-4c15-bd69-5d42b3976bb6","resolution":{"observed_at":"2026-08-12T11:19:33.407841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.413795Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.413795Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:1f8a5428aa00751219927046bee4a77fb8ab6a37ad31ff72ba235ecdc7be5d25","observation_id":"d5a42f71-a392-45d9-b2b2-3cbaa805c1f7","resolution":{"observed_at":"2026-08-12T11:19:33.413795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T11:19:33.419113Z","title":"Qwen tech- nical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.419113Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:8f1fcf3e0addbad8c61e86445398a61c88a7c95a759965a4fed491a11f0e89f0","observation_id":"b45a4f56-b556-43db-aefb-e2d4b3c3a0e6","resolution":{"observed_at":"2026-08-12T11:19:33.419113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T11:19:33.424647Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.424647Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:a2642ef26396868ee739f147dcee8912db5a0218decc0f0badef999edb9a13f1","observation_id":"71826af8-7568-4bf1-bc9b-ab1544bfae08","resolution":{"observed_at":"2026-08-12T11:19:33.424647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.430385Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.430385Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:ed02193b0c36bfe380baf50d147fa5733cbe47c2aa18e0fe3e9bb986d3187e61","observation_id":"cb1b61d5-4e9c-4d97-8934-4b7736802cda","resolution":{"observed_at":"2026-08-12T11:19:33.430385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.435695Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.435695Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:de1db35a355fb5f7ae02bc593a717bad1129b2346b94cabbffcba5b8e7f94873","observation_id":"146bd734-fea4-463d-a617-9f530aa56289","resolution":{"observed_at":"2026-08-12T11:19:33.435695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-12T11:19:33.440573Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.440573Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2a6c2ffbec357dd2cbc847ca65122ec77c48b4dd80e3373e4170d29d38d13a25","observation_id":"7e8970b8-d77c-4241-8f49-99cdb15e5af5","resolution":{"observed_at":"2026-08-12T11:19:33.440573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T11:19:33.445705Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.445705Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:02dbdde93434bd53a5a32289a35e0562898cccc098177ca0c454b6233a0cd403","observation_id":"cca999a6-3ed2-4824-b53a-430952dd752f","resolution":{"observed_at":"2026-08-12T11:19:33.445705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-12T11:19:33.452132Z","title":"Are we on the right way for eval- uating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.452132Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:76e76bb26b0cdad814c8f259e5575ce207e5b6a4b38102652e36540afad2b428","observation_id":"d68b7adb-325e-42fc-bc3f-ebd6a2762b75","resolution":{"observed_at":"2026-08-12T11:19:33.452132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-08-16T17:54:48.921016Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-12T11:19:33.457024Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.457024Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2b3b7de473e405fa12823a74d38de5ef0799fad986e8e09d943ebafb9ce9a72b","observation_id":"db34f812-49d6-4670-9d15-af0173f4aa64","resolution":{"observed_at":"2026-08-12T11:19:33.457024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.462248Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.462248Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:07c5adfb7cbb4405a7c9825066db21e67d5246675b80aec9ed5577a985e618aa","observation_id":"2eb280a1-fc0d-47e9-82fb-2092ce0e5a12","resolution":{"observed_at":"2026-08-12T11:19:33.462248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T11:19:33.466916Z","title":"How far are we to gpt-4v? clos- ing the gap to commercial multimodal models with open- source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.466916Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:8b997ca96ce9c913c888ce140a2e9f3d335b46ee7d5224fe2060955b62a1f27b","observation_id":"a1a09cba-1bdc-489f-b76c-7b3de7cdc07a","resolution":{"observed_at":"2026-08-12T11:19:33.466916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.471677Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.471677Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:fbea46b3c68899fbd32ff6a31017fa74e3b99f05b5e66db386093e7feac15cd0","observation_id":"241ac1b8-5919-4888-9aad-0b3a69b7be11","resolution":{"observed_at":"2026-08-12T11:19:33.471677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.476539Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.476539Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:9cf84c4d5b105c1e4bd70d8b8756b2817e71cf9ac6af82e610a7c2e1a06a414c","observation_id":"6f058612-92d3-489e-a933-6acc46081016","resolution":{"observed_at":"2026-08-12T11:19:33.476539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-19T13:25:25.058603Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-12T11:19:33.481133Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.481133Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:b0545617ac023464c73176716b970e6d0fdca2dfda4e5d309e8efb56b19decd4","observation_id":"1f6eefa9-d1b1-46b9-b45c-46c7e763d4ca","resolution":{"observed_at":"2026-08-12T11:19:33.481133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-12T11:19:33.487065Z","title":"Molmo and pixmo: Open weights and open data for state-of-the- art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.487065Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:901af09723969f01b6ac407ee5a4d3bfb1a21356cd9e72828426a7a00ebab854","observation_id":"e7f48ef1-a536-4061-a918-14a515830312","resolution":{"observed_at":"2026-08-12T11:19:33.487065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.492658Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.492658Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:37fed4a3a119c830c66b6e1d90e9f7a3d9b2ea582ddf0215fbfbe878a95d0aa4","observation_id":"afeebe99-5d8d-4ba4-ae3e-dca7a3a4dbfb","resolution":{"observed_at":"2026-08-12T11:19:33.492658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-18T00:33:47.386234Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-12T11:19:33.497294Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolu- tions from 336 pixels to 4k HD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.497294Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:c4c518d04a1fe89bf1362d9a36531515afc0947a812ba1b756f26fd7b3122a54","observation_id":"b960f285-0db9-488b-8b22-0e20c266cc44","resolution":{"observed_at":"2026-08-12T11:19:33.497294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.502100Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.502100Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:32d5bcfa3b3d0c87bfb502e1531d74cdb788d5f9353a21b3bc6be5452b961356","observation_id":"a7918d0a-81da-4f83-b4f1-b3a453d2efe6","resolution":{"observed_at":"2026-08-12T11:19:33.502100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T11:19:33.507002Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.507002Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:625b636af8f745e39a840cfc4e1d818e37976947f853f283a8fe9f5922cb45f8","observation_id":"6bb12e2d-fa7e-40de-a793-2c002d74c98b","resolution":{"observed_at":"2026-08-12T11:19:33.507002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.511859Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.511859Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:0a8addcf309930b08d787d23181a2f81da4794f4b0c2ae9606018eedec19f371","observation_id":"59ca6b0e-b4db-4829-9ad5-b4df2e2e313b","resolution":{"observed_at":"2026-08-12T11:19:33.511859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-19T10:24:15.607193Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-12T11:19:33.517203Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language halluci- nation & visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.517203Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:066a9717b3d2ff0309e7a2ee5a9daa45a238f648e2590cc98a356a50f9194cde","observation_id":"0e50e920-6395-4c51-a79f-41d74f7b8f78","resolution":{"observed_at":"2026-08-12T11:19:33.517203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.522606Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.522606Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:9418d53719ebcaf0ae5b1e757d333df0fcc07358f852636fc0c498f37fc82a0c","observation_id":"d89c20cc-76c0-4b01-8c00-e816cebdf990","resolution":{"observed_at":"2026-08-12T11:19:33.522606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.528216Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.528216Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:f7c691d0ae5b4205c636c9194703095433efc3ab9dd15c1aff864fbb9e610066","observation_id":"1dbbcd26-de36-43a9-82ee-ad4614138064","resolution":{"observed_at":"2026-08-12T11:19:33.528216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.533761Z","title":"Icdar2019 com- petition on scanned receipt ocr and information extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.533761Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:3769c75e3093aaa2ebad92099c371146395855e6dff814e8e5bd0ab5086ba6cf","observation_id":"4ee50429-81f4-44da-bb38-b3047538be34","resolution":{"observed_at":"2026-08-12T11:19:33.533761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-19T00:16:42.047230Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-12T11:19:33.538690Z","title":"Mantis: Interleaved multi- image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.538690Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:be2350729dc31018eadcc288b7590350bdaab2f8bca3845939eb2e21897ceee3","observation_id":"03ad07f8-1f7b-4ddc-a91e-4d83bd6cd882","resolution":{"observed_at":"2026-08-12T11:19:33.538690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.544189Z","title":"T-rex2: Towards generic object detec- tion via text-visual prompt synergy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.544189Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:803e316a39b9146617d5eb960989e8c68803dda58ee848f6a124754bcaef46ea","observation_id":"e8b21873-11d7-4150-9eab-11a29c6f2f12","resolution":{"observed_at":"2026-08-12T11:19:33.544189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.549879Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.549879Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:51737028d92bbf1e6f0ff978f02ea0791e1db754a17082b7e22b956729a7f695","observation_id":"1c5d74d5-ab14-4d63-a8a2-bdb9adb071da","resolution":{"observed_at":"2026-08-12T11:19:33.549879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.554995Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.554995Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:a27fc5b2f4e3b967c1a6a14520da22597431f51383ddc361588f7561b091e343","observation_id":"a964daef-5fd3-44d6-9fe8-982e2ecf46a5","resolution":{"observed_at":"2026-08-12T11:19:33.554995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-12T11:19:33.560592Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.560592Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:286405c8cd1fd96de940f7b4b51995e5e16c33c6260fb8dd2a7e987ae5f3e946","observation_id":"e0fab3ea-1bdd-4494-a132-ab39c3ed0183","resolution":{"observed_at":"2026-08-12T11:19:33.560592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.565668Z","title":"The open images dataset v4: Unified image classifica- tion, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.565668Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:ec88cc9ac7ea67ee9ce8ae9042d0c492bd2d3e128ddd49181ff6cd6f3a0ea1b7","observation_id":"7ce005b6-582b-4185-ba00-ebbf54d339f4","resolution":{"observed_at":"2026-08-12T11:19:33.565668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T11:19:33.570163Z","title":"Lisa: Reasoning seg- mentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.570163Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:bc7a21d19c7b31b6434c561b1623af97a26ff75bb9dc4a70d6e62210c30365db","observation_id":"abd9a563-b0ef-4a01-992e-f118bbf77b27","resolution":{"observed_at":"2026-08-12T11:19:33.570163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T11:19:33.575794Z","title":"Seed-bench: Benchmarking multi- modal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.575794Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:b8ff938b34bdea8657a4b5598210f9e7481a04bf9e30cc85abfa567ce2a08e68","observation_id":"3a47fddb-585e-4bde-9989-2ed609e05e5f","resolution":{"observed_at":"2026-08-12T11:19:33.575794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-16T13:11:31.171443Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-12T11:19:33.581483Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.581483Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:1ed5b7bee0b11440f20cde0e2e787d83a3459636b2a13ef21dc80cfcccce6e18","observation_id":"206cc295-fd15-4fb3-aad2-fc8a00480be8","resolution":{"observed_at":"2026-08-12T11:19:33.581483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T11:19:33.586763Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.586763Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:e902f33c9a766a4998932ea7610210b642bdf6150fff7b20b195e18466325bd8","observation_id":"34022ed7-6c7b-4b9b-b58e-1d0a0da3565f","resolution":{"observed_at":"2026-08-12T11:19:33.586763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.592398Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.592398Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:d2775ae4ae1eb02d1f9008c8b9a4b87894976e9f303e96f19a724b4afcb30c06","observation_id":"802e4187-9296-4023-832b-b491efc50e33","resolution":{"observed_at":"2026-08-12T11:19:33.592398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.597634Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.597634Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:e0eb025063de96e9dfa2361bf7d2e965f9d5d134695bb0d4e3b432ea614faf92","observation_id":"e63d1198-7f0c-4b6e-bc8d-e84d9693c4cc","resolution":{"observed_at":"2026-08-12T11:19:33.597634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.603708Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.603708Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:4b6a88b0f454c41c3d82d2f60cb344f577154453b346d7cd6cb6e83e7dc9ece4","observation_id":"e376fe7e-29cf-4f28-b173-783ef072a483","resolution":{"observed_at":"2026-08-12T11:19:33.603708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T11:19:33.614251Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.614251Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:692c6eb57616683fc0d03a85c344cefdb3617aa193a43fc1dd16c66828eba52e","observation_id":"80263683-1793-451d-b747-a8208f0cc706","resolution":{"observed_at":"2026-08-12T11:19:33.614251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-19T19:58:40.882534Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-12T11:19:33.619612Z","title":"10 Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.619612Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:e3b66a756035dc5d28cb3554779ac1214cbede848e0097653bd8b4e574405d07","observation_id":"55873e8b-ff74-4978-b429-92c8535b0f80","resolution":{"observed_at":"2026-08-12T11:19:33.619612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T11:19:33.625353Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.625353Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:6c0b845a44d9b9994d957d7770c3d63b33f59f2fd0fbe6ebd0a3ac7b318dd79b","observation_id":"03250065-3e06-4edf-a99c-4269ecb23042","resolution":{"observed_at":"2026-08-12T11:19:33.625353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.630977Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.630977Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:c5ba589b430928335509a95bedaa28496507e1fc049db1ab22d70c98de4c3575","observation_id":"245b8a8b-6018-45b7-89fb-3618ebecf326","resolution":{"observed_at":"2026-08-12T11:19:33.630977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.636393Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.636393Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:3143cf9ae8d5c5ee37f34d573f7912e275f9920381a6d77dff5fc53d39163261","observation_id":"8ea6f3b6-3f0c-4e31-8145-d806fae5eade","resolution":{"observed_at":"2026-08-12T11:19:33.636393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-12T11:19:33.641744Z","title":"Draw-and-understand: Lever- aging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.641744Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:0ce9c67eef880b7c426c7e4ef9c97c521dc4ec9dc8b14cfd3c24a4efba68fff4","observation_id":"53f9e16a-ded3-4fcd-ae61-c5b315355dbf","resolution":{"observed_at":"2026-08-12T11:19:33.641744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-12T11:19:33.647571Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.647571Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:b637d1b7ee04bb13481eaa7a1f9e8fb8af5f6cc1945d4e680da4a344bfce90a3","observation_id":"376387ea-5c5f-4575-87a3-8facbff5244d","resolution":{"observed_at":"2026-08-12T11:19:33.647571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T11:19:33.652553Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.652553Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:1e429f8710ae26a1294c3245bc3a2bb691bfd1d7c85ba30430522861b1d36d94","observation_id":"bbf46bb7-cd75-4769-b4ad-1f09d8a9e86e","resolution":{"observed_at":"2026-08-12T11:19:33.652553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.658293Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.658293Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:63665cbffb0b0c1057ce8018be3cca66db6b5f3a3a32088f3089fd8fd4d31fb4","observation_id":"fefe776c-5636-4920-95f0-f98fa39dcada","resolution":{"observed_at":"2026-08-12T11:19:33.658293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.663513Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.663513Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:d2d8dc197dfc736b60a547a0156b745ebd3b427b01fb6c6621590f2746bde11b","observation_id":"e72ebb23-5906-4e13-b8c3-e6bbe368bb3b","resolution":{"observed_at":"2026-08-12T11:19:33.663513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T11:19:33.668807Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.668807Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:4a9c426e48d3e6d03eb5b55a6bbf7a28fff31564434f5c9016f71baeed4b1738","observation_id":"6a7e0f3e-3217-41eb-8e70-680987f1715e","resolution":{"observed_at":"2026-08-12T11:19:33.668807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T11:19:33.674747Z","title":"Mm- bench: Is your multi-modal model an all-around player? arXiv: 2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.674747Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:af1ef86330f53d939bcb182330be983fdb1eaf5661579ca340c8ffdee844f631","observation_id":"054af2fd-d678-4085-9848-0c951120dfd5","resolution":{"observed_at":"2026-08-12T11:19:33.674747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.679611Z","title":"Ocrbench: on the hidden mys- tery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.679611Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:ddd8c679174a0d5e5c5973eb833681306b0b88be5e0e8cb0245a625f184d0077","observation_id":"f0ab74b2-b8dc-4fa1-b349-6a84fd32af55","resolution":{"observed_at":"2026-08-12T11:19:33.679611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.684940Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.684940Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2038f627fd46aef1fde7df7aa8ed7d24cdf58b60aca7e417c4dbeb1fe8d6e97c","observation_id":"5d7cd212-b136-426c-b6df-5f3e4774d97b","resolution":{"observed_at":"2026-08-12T11:19:33.684940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.690640Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.690640Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:f069208963ac3998b7c5db2c924a4dbd934a93c71380447a3d5c7230ebd0d46f","observation_id":"51de555d-bcc4-4124-87cf-cc1909032f9a","resolution":{"observed_at":"2026-08-12T11:19:33.690640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.695648Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.695648Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:23836f93b74de9bd350f387b933c4b1e90cba631921b19d36546d576cabb2de3","observation_id":"e184c4b4-aed2-4705-968d-2d608eb88878","resolution":{"observed_at":"2026-08-12T11:19:33.695648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-12T11:19:33.706382Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.706382Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2808a6f40f4cfcdafdec5981aba9e69c5d48423ca717638a9d6ced54dcaf7bc9","observation_id":"90033afd-268b-4609-a24f-234dfbff9486","resolution":{"observed_at":"2026-08-12T11:19:33.706382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-16T14:59:04.213971Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-12T11:19:33.711726Z","title":"Kosmos-2.5: A multimodal lit- erate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.711726Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:8ecb6eab6e0ade8b59fb4a2226405b59a500985395f2128a1103e474e786a947","observation_id":"ec05580b-55f9-47b3-8f33-4751a25e6efa","resolution":{"observed_at":"2026-08-12T11:19:33.711726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-18T22:58:15.427663Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-12T11:19:33.717150Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.717150Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:5316d3a413b03a53a432b434a52f6295f857f3f4a38c3a1f73a19a190357e81c","observation_id":"12308234-30e1-44ed-814e-28e2f36fb9b3","resolution":{"observed_at":"2026-08-12T11:19:33.717150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.321876Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"356aac35-7d3e-42cb-8dd3-40798dec922f","year":2016},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.722879Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:a36da78f71ef810742f37b0245c52077dab9c6ff4dc91e12c3a4276e59c02b3b","observation_id":"b4534563-8430-48b7-b1a8-c5a984c02213","resolution":{"observed_at":"2026-08-12T11:19:35.327069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T11:19:33.727517Z","title":"MM1: methods, analysis & insights from multi- modal LLM pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.727517Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:daf037e221c579eacdd2439cba9fd1605a68cae488131efd9e3258d9c7833a0a","observation_id":"86f407a5-eaf7-469a-849a-5252c052f3ba","resolution":{"observed_at":"2026-08-12T11:19:33.727517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.732753Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.732753Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:ff12a8b9d88e6e8d485801bef8882714766917e7a30a0e8df1b3273c6f1b09dc","observation_id":"fa6d93a9-769d-48be-b490-20f46a7cd755","resolution":{"observed_at":"2026-08-12T11:19:33.732753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T11:19:33.737406Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.737406Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:57c9cfdc084f032d69f7920d5254e357cd14d83fa780785a5f5541c2f63842a6","observation_id":"25cd984b-fce6-4e41-a3ee-6e93e8620074","resolution":{"observed_at":"2026-08-12T11:19:33.737406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.294595Z","title":"Perceptiongpt: Effectively fusing visual perception into llm","venue":null,"work_id":"bf6610a5-e990-418b-a419-233f10abac6b","year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.742754Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:4f118d112f4da439def20df764be371bee0e7b015d77222e49d75a910a191484","observation_id":"dadb70b8-5652-4eaa-97d5-19a2cab5ec6b","resolution":{"observed_at":"2026-08-12T11:19:35.299413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.277577Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4c448162-0ee2-4a59-9023-d4bd69a402a3","year":2021},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.748671Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:362329ec063be0889264b8d05169e18694feb3052ede12fa1f5a131458492fbd","observation_id":"695c8c57-982f-45f6-afe7-95b205ba2046","resolution":{"observed_at":"2026-08-12T11:19:35.283423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.261295Z","title":"Paco: Parts 11 and attributes of common objects","venue":null,"work_id":"042cf42f-94ab-417e-a0de-e91368702211","year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.754204Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:7a707a99634867386c0154261a08683acad8a5e31f57d5c98c85f186d03fa2da","observation_id":"196b3d6d-c0c1-4c75-a44e-858f16d654ef","resolution":{"observed_at":"2026-08-12T11:19:35.267026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.759129Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.759129Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:3554277346cfb9e47c3de825c25dc36c5ecc79668cfa4b48add17648d2229f6b","observation_id":"f75b2626-cb3c-48ef-abd7-476173ae6985","resolution":{"observed_at":"2026-08-12T11:19:33.759129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.236455Z","title":"Girshick, and Jian Sun","venue":null,"work_id":"e420c2fd-dcdc-4957-b152-15e743449118","year":2015},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.764632Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:0b628c5a74c5d7276647bbb85120487391db1a70205fa6712a01712effb6ab84","observation_id":"3465c83b-5709-461b-82d7-7b104d721219","resolution":{"observed_at":"2026-08-12T11:19:35.241138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-18T15:29:02.493000Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-12T11:19:33.770035Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.770035Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2a516606b21d29a1c5070304c53a308e52181e208274b0b97e4a69ac75aee6cc","observation_id":"e233440e-e0bd-4320-8839-c0e8c2d4740c","resolution":{"observed_at":"2026-08-12T11:19:33.770035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.775985Z","title":"Generalized in- tersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.775985Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:dac530cd9461f5d1c84eecf01c57d9c5d88f3e83f098677b6d09211c933f1690","observation_id":"e23fd7e0-2519-4635-9a3c-4bd43e84d4b5","resolution":{"observed_at":"2026-08-12T11:19:33.775985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.211077Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"19264471-e08f-486b-ba98-9ae4c0085e2a","year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.780868Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:c6452e6203b4dbadc83b887709ca18ac8353fb7365b0bed52b4b876d92c1789b","observation_id":"2df2c1ad-5e8f-4522-af0d-e33ed65c0154","resolution":{"observed_at":"2026-08-12T11:19:35.216046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00123","last_updated":"2018-04-30T22:49:54Z","snapshot_observed_at":"2026-08-18T12:19:33.223037Z","submitted_at":"2018-04-30T22:49:54Z","title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00123","snapshot_observed_at":"2026-08-12T11:19:33.786399Z","title":"Crowdhuman: A bench- mark for detecting human in a crowd","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.786399Z"},"links":{"cited_paper":"/paper/1805.00123","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:f031d6639cf68f837c5b01a81223c04c03fcfc64d0b53890f9e0336f0285f0b4","observation_id":"b64f5af3-eca8-406c-b2d0-db2b54e7940a","resolution":{"observed_at":"2026-08-12T11:19:33.786399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.195450Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"28027127-a87f-447c-a4ec-1b92490d99f1","year":2019},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.792175Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:794170441d168531426d5a085ffe8f3d6f8e2d5c3fd87437edf97363b0684e63","observation_id":"12e98316-3883-4cfc-9989-d427f362307c","resolution":{"observed_at":"2026-08-12T11:19:35.200779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-16T13:23:07.170488Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-12T11:19:33.797984Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.797984Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:b174733eb50da830c80728b87f346524935563be2262c889b781c3d803576176","observation_id":"df506477-f157-4d6d-9192-7b5a093d8d76","resolution":{"observed_at":"2026-08-12T11:19:33.797984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.179002Z","title":"Towards vqa models that can read","venue":null,"work_id":"37e13bb8-fd35-4ce5-acd2-c9e471e1ea18","year":2019},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.803140Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:61e5f1b7c391831fa98243d3e242fb0af3eaae37eb58a23f3374de9f84ebff85","observation_id":"0db5c0a3-e366-42fc-a107-a04da1d506f9","resolution":{"observed_at":"2026-08-12T11:19:35.184568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.163295Z","title":"Hashimoto","venue":null,"work_id":"17d0e8ed-eeab-4710-b575-e1baade9448f","year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.808437Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:063aa21abd373482d12f17bb902f4825184d31bd004ac447fa5396b3999cb36b","observation_id":"9e0afbd2-cbf9-4e2d-84d4-688df13d5798","resolution":{"observed_at":"2026-08-12T11:19:35.168651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T11:19:33.813622Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.813622Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:acc75b06b811d7ed8eda954599381984713485522e7fdea2210bb73133fe4776","observation_id":"e0f781fb-9217-4ebc-a702-0b76aa3adebc","resolution":{"observed_at":"2026-08-12T11:19:33.813622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.819373Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.819373Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:256351f08b41765bd56d8008fa7f961a161cfd99afa4b51644722aaa5860a47f","observation_id":"c29c3f7b-339a-4bcb-9a09-81316e169f4e","resolution":{"observed_at":"2026-08-12T11:19:33.819373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.138051Z","title":"Cambrian-1: A fully open, vision-centric ex- ploration of multimodal llms","venue":null,"work_id":"a4d13fd5-9f3f-410d-a155-6a35bccfd87e","year":2025},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.824318Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:6eaaf7337efa40b7bbf7485ba158eeee23a3b88e6f14ff5b9f0d34a04228fdde","observation_id":"f51eaa3d-f744-476d-89b1-d1ffcf935919","resolution":{"observed_at":"2026-08-12T11:19:35.142772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T11:19:33.829556Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.829556Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:da68e31c91eb862e59b6b6a544d4f0494a410d2981ec0ce45f8bcd13cab6c682","observation_id":"beef477f-9c6c-46d8-a5a7-a21083fb81e4","resolution":{"observed_at":"2026-08-12T11:19:33.829556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T11:19:33.834775Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.834775Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:c5a06c9284c61566205575c532dd567df12451ee24e135553898216af7e2abc4","observation_id":"b2c85656-9442-40bf-807e-5c882275d847","resolution":{"observed_at":"2026-08-12T11:19:33.834775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:19:33.839351Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.839351Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:2077d5f30e1a2f69190cca0bc7997a79a99ed818fce7640e56d57de44dc57c4e","observation_id":"bf20ef6e-2ef1-4fba-bd1e-9ebc317301a6","resolution":{"observed_at":"2026-08-12T11:19:33.839351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T11:19:33.844286Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.844286Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:12131ebbab43ef3348138bfbf026fb0ebbc172ba71f022d3bbab8ef2c9e7c76a","observation_id":"30464c58-6124-4646-ada6-e74e40fd90e5","resolution":{"observed_at":"2026-08-12T11:19:33.844286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T11:19:33.850035Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.850035Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:67825d43eb69b06ee0b39efb73f417cc327df1354aadaad4a88780400121b2d4","observation_id":"585288b8-058f-4bc6-a95a-b5a3a7a589b7","resolution":{"observed_at":"2026-08-12T11:19:33.850035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-16T13:43:39.938123Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-12T11:19:33.855529Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.855529Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:cef7ad139911f20b208bd0bc1b7893ab5090af1ead2292543b3bb53f5f8a3f8c","observation_id":"b495736b-61db-4173-a1ef-e5670de323a0","resolution":{"observed_at":"2026-08-12T11:19:33.855529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.123441Z","title":"Florence-2: Advancing a unified representation for a va- riety of vision tasks","venue":null,"work_id":"0d01b3a6-d925-46c0-ad84-01b15c0f0548","year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.861408Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:68b7a6cad1cbb3006962a3d0518ce37040c658ca6d4b7753b8f603c5034914df","observation_id":"8dde6206-e697-4acf-959d-817503224947","resolution":{"observed_at":"2026-08-12T11:19:35.128195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-19T05:29:03.467497Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T11:19:33.866411Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images.arXiv: 2403.11703, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.866411Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:23ac76b6ccb2b0d8d329ed8bd2fafee09908cbd4d4aa9c7e63600db0b069c8c8","observation_id":"33b7389b-5513-4a1d-9481-c34d3bcb9e98","resolution":{"observed_at":"2026-08-12T11:19:33.866411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T11:19:33.872055Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.872055Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:6b0602ee4dbf3ee67e55ac481babe3d3839e71743cd525a13f8eff0525fb284b","observation_id":"b24a736c-29db-4215-baa7-c81b097b72d5","resolution":{"observed_at":"2026-08-12T11:19:33.872055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:33.877696Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.877696Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:bde30e8fab21865df84324677f2254c9d4af5902b8f7d52eea11ca20297513f8","observation_id":"cead7cea-608a-445e-9452-62dd927f3976","resolution":{"observed_at":"2026-08-12T11:19:33.877696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T11:19:33.883200Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.883200Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:7fb98080eca2481f64e0da352365376ab0d0f827b2074b4b15cddec6eff448cb","observation_id":"2e92401f-df96-4bea-9e3c-f3172154ebf9","resolution":{"observed_at":"2026-08-12T11:19:33.883200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-12T11:19:33.888396Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.888396Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:9c8a57576f06bb86c9fb30bf4ad0996e675e88f8f1c9d65884a52e96c7023901","observation_id":"4b81d476-9c47-421c-a7eb-51cd12d2db36","resolution":{"observed_at":"2026-08-12T11:19:33.888396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-12T11:19:33.893651Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.893651Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:e54f00e1d93899d6fd3a01d0b6ecb1732428f89f938c15b9875b0963327082d6","observation_id":"c2e09333-7e0d-484b-959b-c8401490223e","resolution":{"observed_at":"2026-08-12T11:19:33.893651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.107099Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"ca55308d-ef1b-426f-94c5-0ee01e83791b","year":2016},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.899019Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:984ae5f13f220626780cdc29d4c2cff5e2e110eedf1742780c66e7829d4b7ce2","observation_id":"70984f70-42c8-4e13-93e4-30c46108de17","resolution":{"observed_at":"2026-08-12T11:19:35.112385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-12T11:19:33.904672Z","title":"Mm-vet: Evaluating large multimodal models for inte- grated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.904672Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:f4302986234af137c00656af3f9a1fadf7d4bd9cb0d92a47fde8236cce58f84d","observation_id":"76703c34-0d78-4813-a605-f8e98b935373","resolution":{"observed_at":"2026-08-12T11:19:33.904672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.088677Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":"787987c5-9f2c-425c-a4fc-0a8a9512b1fa","year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.909509Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:99ad1070a5bc3ff14bf8ef95f76e93472a2a4d734634fa5769a0e6958505320c","observation_id":"c24e2520-c16b-4e88-8344-794e34c4f095","resolution":{"observed_at":"2026-08-12T11:19:35.094725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-17T13:10:52.611064Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-12T11:19:33.914045Z","title":"Mmmu: A massive multi- discipline multimodal understanding and reasoning bench- mark for expert agi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.914045Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:d7c48fac3f6e9389c30592eca9e55153fa58d2bb328d271fcfe8e5a5d029d897","observation_id":"70e6fbe0-9b32-4049-9a34-519dc19d1341","resolution":{"observed_at":"2026-08-12T11:19:33.914045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.073047Z","title":"From recognition to cognition: Visual commonsense rea- soning","venue":null,"work_id":"06156530-9bfe-4668-8cf5-3ee947dcfb37","year":2019},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.918748Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:756e1643659313c02bcb2471b0895aca5713d840e1b3ee4cca0347b7523859ab","observation_id":"4f46053d-b3fa-41d8-94e2-129f3ee57a77","resolution":{"observed_at":"2026-08-12T11:19:35.078043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09333","last_updated":"2025-08-11T06:33:05Z","snapshot_observed_at":"2026-08-20T05:32:51.333260Z","submitted_at":"2024-03-14T12:21:37Z","title":"Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09333","snapshot_observed_at":"2026-08-12T11:19:33.923271Z","title":"Griffon v2: Advancing multi- modal perception with high-resolution scaling and visual- language co-referring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.923271Z"},"links":{"cited_paper":"/paper/2403.09333","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:c08dade00e794ce4526cea938a3a62fb97aa5aa74e2852f7dca46c4c4fc27394","observation_id":"ce95c1e9-0208-4384-a744-d0282c005580","resolution":{"observed_at":"2026-08-12T11:19:33.923271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:19:35.056795Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"7f76feb8-73c5-404d-9f72-64824ae566e2","year":2025},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.928182Z"},"links":{"citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:d77c9c6f25a6de8ebc07b8e5f4610edf8af7f03ebda114ca03411cc01437547e","observation_id":"c28a04c0-5913-4f92-8649-fb0a03a5f1a2","resolution":{"observed_at":"2026-08-12T11:19:35.061919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-18T07:50:02.322273Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-12T11:19:33.933240Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end ob- ject detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.933240Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:3bf0c7c0d0d12e2e89194774caf6393668442671af067b2c3d700f6669464c10","observation_id":"781524ef-e52a-4a72-8e29-d2400b40ec8f","resolution":{"observed_at":"2026-08-12T11:19:33.933240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":85,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":107},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 107 outbound references and 13 inbound Pith citation observations for arXiv:2411.18363."}