{"as_of":"2026-08-16T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b1cbeececdc4ee466a0e7c43b100dee4f53e402e71866cbfbe5621f1b8a3023","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:20:41.385870Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.18300/citation-record","integrity":"/paper/2507.18300/integrity","json":"/paper/2507.18300/citation-record.json","paper":"/paper/2507.18300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.326747Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"de43234c-fb3b-4fd8-a1fa-5f7805386208","year":2022},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.111541Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:27d1ed75a023cb8264d3ee50b1bfaee95968c3639b897d8f046aa5174f68f146","observation_id":"58ed4f22-b4f8-40ad-a4d9-359276a652bb","resolution":{"observed_at":"2026-08-15T18:20:42.331412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T18:20:41.118189Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.118189Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:ded1619aa588d935512602c10abe70048ee645e677831ebd6e5becd4c1e67450","observation_id":"27805ef5-c316-4dcb-8327-ef1aafee5b34","resolution":{"observed_at":"2026-08-15T18:20:41.118189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.311019Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"e4525630-37fc-4735-9521-658de57694f7","year":2018},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.124440Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c15ba7a9bcc17239394540b33bf28bd280eb3d24a2d4bc86a90493731286ec8b","observation_id":"c03da974-5d73-4943-9c95-182c33f9a3a4","resolution":{"observed_at":"2026-08-15T18:20:42.316592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.295976Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"73e14cd4-c614-46c0-b875-31ec370c868e","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.129824Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:096b47b26744177eb443b77b2f443182adbe239a04dc48b353754c30c7649431","observation_id":"d6888f5f-6120-4b14-bb59-2471112cb795","resolution":{"observed_at":"2026-08-15T18:20:42.300835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-13T11:47:54.095263Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-15T18:20:41.134807Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.134807Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:baaf65290d4ba59df9824c7071ac8f99e9b2e347b8859c4dfdd8b807199c8598","observation_id":"9d2577a7-ffdb-4c06-a5e5-63e52e641ca9","resolution":{"observed_at":"2026-08-15T18:20:41.134807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.280461Z","title":"Allava: Harnessing gpt4v- synthesized data for a lite vision-language model, 2024","venue":null,"work_id":"e7e3d563-a9e5-4c99-9ad9-6e8f3423bd2c","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.140378Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f0032b8ad432a364c2bbda38b479ff4f59bcc9acc1b06f0ef3e74dd29783aa75","observation_id":"5d46851c-81b4-46c9-a20b-822e1986d547","resolution":{"observed_at":"2026-08-15T18:20:42.285513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-15T18:20:41.145863Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.145863Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:d855c48db314c434494454bb87bc4c4e469fa2b7423fb4bfc242f8b5217d3135","observation_id":"5d0fbbc1-6be6-4921-b7d9-c4527c2acd88","resolution":{"observed_at":"2026-08-15T18:20:41.145863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T18:20:41.150411Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.150411Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:2ad03b8f62c6802afad0573ef4619d7b46c8af27431058c6fca18cef309f91d2","observation_id":"f2681c6b-841a-4a05-95db-0ff91859d98d","resolution":{"observed_at":"2026-08-15T18:20:41.150411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.155155Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.155155Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:89689a16be1c5ee83acb39445433a936bbfd242ea8ad3e0fd1d5f94f4c140043","observation_id":"a80e0917-a2be-41b4-a030-a1668d3b4f21","resolution":{"observed_at":"2026-08-15T18:20:41.155155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.159873Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.159873Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:d3122bf3db9185074b79438999520b3fb4ce8e84108ac7781daade2d90470e84","observation_id":"d39d1c4f-789e-4370-bc1d-855a369de980","resolution":{"observed_at":"2026-08-15T18:20:41.159873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-14T10:26:56.366247Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-15T18:20:41.164283Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.164283Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:2747afa6320634e3f833a30a610b627663dbdd21a61d3a0a293a2f79ba37c3bf","observation_id":"344af88c-0b80-4af1-9c1c-219d6367009c","resolution":{"observed_at":"2026-08-15T18:20:41.164283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-15T18:20:41.169091Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.169091Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:807b27054f80043c67ccfd4d548ec7087069f09ff5c9c38e287542be8cd7e6ee","observation_id":"35d22764-04c0-456f-8ac3-6dd7db62aadc","resolution":{"observed_at":"2026-08-15T18:20:41.169091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.243941Z","title":"Salience detr: Enhancing detection trans- former with hierarchical salience filtering refinement","venue":null,"work_id":"cd400280-9563-4595-b2e5-3eb78c566003","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.173863Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:a1f7bdcbc2cd267eca3529550d0cdf60f8b8ba46fdf7600ca40d804ec86b2d2a","observation_id":"b80f73ab-759f-4a65-9d7a-ee91caaefc00","resolution":{"observed_at":"2026-08-15T18:20:42.249214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.227267Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"3a885b5a-15da-4e16-a9ab-6aabba289526","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.178318Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:29b9a2b84830ab19624b5543b6b63ac743ac45dca6a93e743fea66b90d295220","observation_id":"1929c7a6-2409-45b9-b92f-c3a2d481be66","resolution":{"observed_at":"2026-08-15T18:20:42.232628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.210104Z","title":"Detrs with hybrid matching","venue":null,"work_id":"3ebc4cf1-05e2-4973-a159-202a41d75f98","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.182911Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:d627cb4b16bd82bc55a410532346b7ee8ad214c71db115b6c05286cfe5388865","observation_id":"51dc8c80-68d7-4889-8fcd-79fc9d9758a3","resolution":{"observed_at":"2026-08-15T18:20:42.216107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.187182Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.187182Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c77655810c00366d47610a7425d267f69854220cdd6a120ebbeb2718c27f44bd","observation_id":"9a0e7103-7d10-4fe2-9e0e-4f07eb61bc5c","resolution":{"observed_at":"2026-08-15T18:20:41.187182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.182215Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification","venue":null,"work_id":"68fa05bb-a846-422f-ac29-af79fbd1d258","year":2017},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.192354Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:e58bf370736afa9137da54483a15bec34b5c4761c4e934880bb56fd3a79ccd9b","observation_id":"9800eeba-e1b2-4715-a7a4-646b4b1401ad","resolution":{"observed_at":"2026-08-15T18:20:42.187371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-12T22:59:05.910546Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-15T18:20:41.196489Z","title":"Building and better understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.196489Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3834823f8a0400c48fd729d3299cba53399eb59022ce54a45999f82c6cfad5c0","observation_id":"d39e0ca0-c515-4ee9-844a-d43e7d6201cd","resolution":{"observed_at":"2026-08-15T18:20:41.196489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.166444Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"3006bb49-ca0e-4a56-a136-7ad9dfca0e8e","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.201411Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3fa0b0c9f6887cbce6d2bb4a012de681c38ebf154777b21af1f48f239844967f","observation_id":"476c6df1-cf32-4b2d-aa5b-90eddafff098","resolution":{"observed_at":"2026-08-15T18:20:42.171495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.149352Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"31250f0d-cb78-4d1e-a51f-4f6f181c65a6","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.205867Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:eee36c3f6a4995ba5292eb9ecd1db3fe1817b26144b9329f42db4ff961a19235","observation_id":"565cd5ab-fd74-4391-99f2-b2b06f98ee1e","resolution":{"observed_at":"2026-08-15T18:20:42.154303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.132749Z","title":"Generative region-language pretraining for open-ended object detection","venue":null,"work_id":"234a65eb-7160-404b-adb7-40cad75d2941","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.210434Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:270112613b92fa329f91b8e38665271f193186313385838af66d0d5d481b95c0","observation_id":"98281367-7eab-4f27-84a6-8d5c990339cc","resolution":{"observed_at":"2026-08-15T18:20:42.137555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.115651Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"98fe329f-88b8-4498-90e9-d0cd38a0d502","year":2014},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.214842Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:fe5cef1b823fea73ec1b44646b4ac665b7c2a47b8ae10d934f8270b8b8323758","observation_id":"082175c0-5c53-4bd6-8a3e-494d025f87be","resolution":{"observed_at":"2026-08-15T18:20:42.121477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.098534Z","title":"Visual instruction tuning","venue":null,"work_id":"2701dfc7-64ed-4d28-9b70-18e9fa485b12","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.219573Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:570d271b340d171cdaf65db86a8a23fda8246afc4346159de97cc0ddab378832","observation_id":"ee13eab0-2b8b-45fe-a68a-0c7b0b986ce9","resolution":{"observed_at":"2026-08-15T18:20:42.103453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.082887Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"1618e039-38d3-4036-baa2-232afd014aa0","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.224159Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:637a3e4218aeb333af1da582f7ab67c8bf4a17087dba22d4ed9dd20b9ba18271","observation_id":"1b120a8b-eab7-47e7-bd7f-7b30a3a458b1","resolution":{"observed_at":"2026-08-15T18:20:42.088137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-15T18:20:41.229099Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.229099Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:084ec003261e5eaf858f4d7d0441a2cfdad42fb71bcde8ad1c55f9a4d2440163","observation_id":"e431bbaa-d72d-4f2a-8b53-69f2174f4a63","resolution":{"observed_at":"2026-08-15T18:20:41.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08166","last_updated":"2023-10-31T17:51:51Z","snapshot_observed_at":"2026-08-16T09:39:13.010968Z","submitted_at":"2023-10-12T09:39:17Z","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2310.08166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08166","snapshot_observed_at":"2026-08-15T18:20:41.651201Z","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","venue":"cs.CL","work_id":"c9500e1d-8077-4614-b400-704d38610965","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.233757Z"},"links":{"cited_paper":"/paper/2310.08166","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8271cb829978a404c7882d5b4485e9066d3e441514d784e9413e35ca2943e13f","observation_id":"98756f12-295d-4452-a514-451e1932840d","resolution":{"observed_at":"2026-08-15T18:20:41.658332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-13T00:25:53.590712Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-15T18:20:41.238757Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.238757Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:a5ecd6c725a13bcb0ae93725707cde4e8ea04756a5749ed772af1bb650cc5720","observation_id":"c61919d6-a94b-425b-b8c5-06915cb95c05","resolution":{"observed_at":"2026-08-15T18:20:41.238757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.066188Z","title":"Scal- ing open-vocabulary object detection","venue":null,"work_id":"eac82227-433d-4cfb-8f6a-5fcbbb0a677d","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.243496Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3e0bbbfe333e6ac57468e484db221e80e7440aa8b97f3f27b69fbd9b0b200307","observation_id":"052f5567-27c8-4b4c-be71-d7197552d3df","resolution":{"observed_at":"2026-08-15T18:20:42.071999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.049565Z","title":null,"venue":null,"work_id":"dd039f10-7eed-409d-bc68-3260a4b742ee","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.248336Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f77dcde6679808be8688cc5806426fd58f55819147ad55d63e6299558da1f520","observation_id":"a00781fd-abed-48a2-acaa-09997f4b0545","resolution":{"observed_at":"2026-08-15T18:20:42.054615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-15T18:20:41.253210Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.253210Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:daff4295425cc82c46040535d062a853a8c1fe41d80237613d321c5b73bfb527","observation_id":"2f254c71-48af-45ae-932f-27a1aa2fa4ad","resolution":{"observed_at":"2026-08-15T18:20:41.253210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.033205Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"973de7d3-e0bc-4b02-8e10-a3a5affe96ba","year":2021},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.258353Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:e052b887848c93ff788d3bb990b373ca568d61de56c59add2f23ff2d00ffa1d0","observation_id":"b5139c15-b74f-43f1-bee1-28ef7c17ab29","resolution":{"observed_at":"2026-08-15T18:20:42.039031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.262855Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.262855Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f44c624e1cc8d3c74932d3955e2a533cfedf581df3ad2b77d87cd72a9e5f88d1","observation_id":"0b4a0aea-8d96-4d95-9530-be0dd34651e0","resolution":{"observed_at":"2026-08-15T18:20:41.262855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:42.004536Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"fae1999f-d788-4d27-a4ba-838353cd2ea5","year":2016},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.267864Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:e20d61613bf6fd6a63d5b57e0473e7baded1f82956838826aa70359cccc5bf8e","observation_id":"837f13fa-8959-442a-b801-bc624c644b0d","resolution":{"observed_at":"2026-08-15T18:20:42.010266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.988437Z","title":"Grounding dino 1.5: Advance the \"edge\" of open-set object detection, 2024","venue":null,"work_id":"66f387b1-fb5c-4843-94f6-49b9c6d0e55c","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.272251Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c73bd1169d6efbb8a5feca54da36c94e5ab11bc1b2e588bfe3b987eada5d8106","observation_id":"6cd99452-18f4-4f55-99e5-0da38c2b3aa0","resolution":{"observed_at":"2026-08-15T18:20:41.993470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.973123Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"b8de574e-eee3-4e0b-ba83-16b551e756cc","year":2019},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.276858Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:a6d0ba9dd5d2737f859e4921d9c728f1ce2178ca6a849a4a904e2f8c2fa85bbf","observation_id":"49ccb3ad-52a0-4065-a8cd-990bbf6c9447","resolution":{"observed_at":"2026-08-15T18:20:41.978046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.957531Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms, 2024","venue":null,"work_id":"28c55577-d276-4bd2-83bd-535af14041ff","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.281336Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:4c29b6656c0753e0b3654c42ffa05068134df21b35973f66f69ff796d53bf92f","observation_id":"b870a08f-6937-4ea0-895f-4d4287904f6e","resolution":{"observed_at":"2026-08-15T18:20:41.962458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.942416Z","title":"Iaa: Inner-adaptor architecture empowers frozen large language model with multimodal capabilities","venue":null,"work_id":"2adc76b1-7490-4254-b8b8-6eea76fcf8cc","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.285832Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:29ad2b53da9b578723d8df06f3bb28f1fdade74d2e5e0b032e5ac3499df720ab","observation_id":"0322734e-0a1e-4d52-b725-2d6e3fae8019","resolution":{"observed_at":"2026-08-15T18:20:41.947188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T18:20:41.290110Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.290110Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3aead8f2566903bb3411542215df92b208cc65a577cc38b617bfdd97c8f5f8cd","observation_id":"468d53aa-7fe4-4c97-8da8-343b9e703d7b","resolution":{"observed_at":"2026-08-15T18:20:41.290110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-14T15:00:16.011597Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-15T18:20:41.295610Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.295610Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8e83820d4d31da6d4878f4ba10c19403707f78a7fbdba901e818e422a87ede60","observation_id":"8fb52397-f1fb-4d66-8565-f7bb61048fbf","resolution":{"observed_at":"2026-08-15T18:20:41.295610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-15T18:20:41.300411Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.300411Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f0eb0214d65a5246838251c8c7bb3c67868c81b11601f2320c2e3d89912ad04b","observation_id":"e79f9c03-8f8e-4163-8f48-d84cf427e9cc","resolution":{"observed_at":"2026-08-15T18:20:41.300411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-13T05:37:48.347148Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-15T18:20:41.304607Z","title":"Skywork: A more open bilingual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.304607Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:10cf6ba13f072c00aac91613bf74194e5d9d4741e6567b28a47481c7b0e61cf6","observation_id":"be62617d-1ea0-40d5-a7ab-2180920b719e","resolution":{"observed_at":"2026-08-15T18:20:41.304607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.926673Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"16e96028-b99a-4277-922a-77fa6b59f62e","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.309479Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:79cc48ea2c9eb4e37abb69393667260f9e4cedd473ca4f5158e6c4aea3b94dc1","observation_id":"ff4647ae-7bcd-46f1-b7d6-d1feb6494acd","resolution":{"observed_at":"2026-08-15T18:20:41.931671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.910209Z","title":"Deepseek- vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":"eaa9649e-7fa8-4248-a890-ce1970500709","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.315064Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:0a6f1566d0aa85eb428167581018048dd91b8750c4f47e1703453583b1b27c4f","observation_id":"8ca45a51-e777-490b-9d47-ac8345db92a6","resolution":{"observed_at":"2026-08-15T18:20:41.915560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.893672Z","title":"Ccmb: A large-scale chinese cross- modal benchmark","venue":null,"work_id":"89ef8983-9d01-4517-91a1-82e5997679d4","year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.319711Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3806909534091bdf3de6915d89d60bee82977a88d5abb60dda7e61d2e9399d22","observation_id":"046407b3-8617-4bad-93dd-d6babea75009","resolution":{"observed_at":"2026-08-15T18:20:41.899307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05071","last_updated":"2025-05-21T06:18:41Z","snapshot_observed_at":"2026-08-15T23:11:46.794725Z","submitted_at":"2025-05-08T09:06:53Z","title":"FG-CLIP: Fine-Grained Visual and Textual Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05071","snapshot_observed_at":"2026-08-15T18:20:41.324154Z","title":"Fg-clip: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.324154Z"},"links":{"cited_paper":"/paper/2505.05071","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:699861e6cdd5fffee3aa4f29688f4cb467b7f193eaf8dfcb453c15ac772ee68b","observation_id":"4c9c66b6-a221-4452-863c-7827fa9e2d26","resolution":{"observed_at":"2026-08-15T18:20:41.324154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.877359Z","title":"Llava-cot: Let vision language models reason step-by-step, 2024","venue":null,"work_id":"5d07dc78-1d18-4d8b-ab0b-084cc8717a34","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.328936Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:ce3bc8dd123525bb8cd7b511c9abe8bd665ecec04e310d434b1b5dd44b8e6d58","observation_id":"a4af59aa-d814-470f-b77b-9845ee14c2f8","resolution":{"observed_at":"2026-08-15T18:20:41.882457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T18:20:41.333364Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.333364Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:6f23e602bf2d14983c7c6307e228eae353cf64ea4f0a9c5f0f97775efeda9d41","observation_id":"e7e450db-e393-40cb-b8f8-ba493cc0aafc","resolution":{"observed_at":"2026-08-15T18:20:41.333364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-15T18:20:41.337989Z","title":"mplug-owl: Modularization empowers large language models with multimodality, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.337989Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:64c64d822a99b4511ddc761e6bb20829321eced3fc6aa26347aad5e257f3e051","observation_id":"36d87560-cc15-4da0-9f18-62bc53828daa","resolution":{"observed_at":"2026-08-15T18:20:41.337989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-15T18:20:41.343049Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.343049Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3976902dbe6d0a6efe1035e7b90e9944e42b69ec556ee9aa35124c40af0d7fed","observation_id":"25938f21-ddf7-4d62-b1a7-7c9a3aed47e2","resolution":{"observed_at":"2026-08-15T18:20:41.343049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.860595Z","title":"Griffon v2: Advancing multimodal perception with high-resolution scaling and visual-language co-referring, 2024","venue":null,"work_id":"fbeec279-bb83-40cf-b832-279861ce6685","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.347776Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:c4e5dffe7dc69b53ece22379784a47132e99d1e0aa8f7c5756dcd57ecfa79f8e","observation_id":"5bd2b0d3-8bcc-4278-b687-13d9cf31877b","resolution":{"observed_at":"2026-08-15T18:20:41.865686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.844409Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"ffc7635b-a78b-4055-9132-43cfa5136507","year":2025},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.352754Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:76a52715c8ca9caa53947e7a852c00b5cb94c41d4069069d523ad14a20d72a7c","observation_id":"05456998-e84d-446b-87f2-f5cab2bb312f","resolution":{"observed_at":"2026-08-15T18:20:41.849590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-13T05:09:19.962189Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-15T18:20:41.357690Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.357690Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:02d3d35364899a50053686c1176281d1af3de3f7d47f75b19c345f257f75f813","observation_id":"5adb5b21-dda0-4a01-98fe-8b0fe5af8fa1","resolution":{"observed_at":"2026-08-15T18:20:41.357690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T18:20:41.362335Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.362335Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:0de9dd8775ca86b7d964d49aefe20af3d53fb2d17875db49578d4cd120237a38","observation_id":"8ff683b7-901f-48ef-a96f-1e6668a92687","resolution":{"observed_at":"2026-08-15T18:20:41.362335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-13T00:32:27.032316Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-15T18:20:41.367508Z","title":"Ferret-v2: An im- proved baseline for referring and grounding with large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.367508Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f4c8d241919dc41d97d6795f6a22cd942f901eee472a2dc75bdb222ba0099dd1","observation_id":"acf63f30-37ca-40c5-8b35-65724dc9e9ef","resolution":{"observed_at":"2026-08-15T18:20:41.367508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.827171Z","title":"Detrs beat yolos on real-time object detection, 2024","venue":null,"work_id":"9538d0b5-3aa2-4bce-9975-c5fcb5a7ad55","year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.372330Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:3473b80a5f1ba29db6fc38ff3beec81b723a66caafb63ae11f9381236846b09f","observation_id":"acaece5a-8065-43db-ae5e-13efe8aae67f","resolution":{"observed_at":"2026-08-15T18:20:41.833175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T18:20:41.377155Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.377155Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:f41276aaa840254b451f4b9fc465cebb19b746d188d495cb65f386e70995ca02","observation_id":"841aa40c-cb43-4908-b970-6244ff139a4d","resolution":{"observed_at":"2026-08-15T18:20:41.377155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.811405Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"b0cc452c-178e-4309-9da6-1032a86493be","year":2021},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.381597Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:116b46d327a230bc3173a8c713846e37407f1a87ac23692733c43dab991d8ff5","observation_id":"f1f79241-7ff3-4be4-a236-f2768dab37fe","resolution":{"observed_at":"2026-08-15T18:20:41.816775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:20:41.795693Z","title":"Multi-step","venue":null,"work_id":"5cd6708d-eb54-4874-82f9-29e470481b5b","year":null},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.385870Z"},"links":{"citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:8cda7a8901a42ef8a374fbc5b3edf37f01c9d9ee48fb09e3b36628aad6fbba83","observation_id":"ae4fb308-6e4a-4e4b-92ce-a1acdf958aef","resolution":{"observed_at":"2026-08-15T18:20:41.800601Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:13:05.693046Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2507.18300."}