{"as_of":"2026-08-08T20:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4018d83a69febebd373760ca4550d37372072de26ef4700ade884e0e0f46d372","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:39:48.245781Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:35:37.095627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:11:09.424972Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"cited_work":{"arxiv_id":"2508.12263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65b7264b-7ce5-475f-b9e0-65d62de1f9a6","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2508.12263","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:4c0a105121a5a700a5f5b28cc0fa35c680fbe61e6815639f264c2cff375c7099","observation_id":"9865e114-cb2d-446a-9799-6fb45b263c7f","resolution":{"observed_at":"2026-05-11T10:11:09.472995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12263/citation-record","integrity":"/paper/2508.12263/integrity","json":"/paper/2508.12263/citation-record.json","paper":"/paper/2508.12263"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T19:39:48.022168Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.022168Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:68bd43df8dbbb53b5cd7fc26f255226117fb1e1ba200d99e63686a457b8f63f3","observation_id":"c6aea20c-74fd-41b4-953c-32687809851b","resolution":{"observed_at":"2026-08-05T19:39:48.022168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T19:39:48.032858Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.032858Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:ca85af08704a79673afa3869a8c192a1f3d60b10aa1169fda9168a1a9f86d98c","observation_id":"7df1ea6a-cf53-4abe-8f61-2d24ae8de02a","resolution":{"observed_at":"2026-08-05T19:39:48.032858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T19:39:48.041259Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.041259Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:93ff978d42e6a4574385d17aa673d4589fde0149bcfd81fbce2a3766871258af","observation_id":"8424158f-e0c5-4b3d-9f5f-c5aab1d835ac","resolution":{"observed_at":"2026-08-05T19:39:48.041259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T19:39:48.049375Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.049375Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:0ceb3ec5d12b94795340518687b47085e0c16dd9096461f9ef578b9c53115785","observation_id":"6a73e7ef-8b2c-40c4-b159-6154601ab78b","resolution":{"observed_at":"2026-08-05T19:39:48.049375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T19:39:48.055078Z","title":"Deepseek-vl: Towards real-world vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.055078Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:a81c0ca8e7397c0310f94596569b49a174703eb4bc02f29280cdc659f8e8c214","observation_id":"ec805674-2e99-49b6-8ff8-56e581a3b0f5","resolution":{"observed_at":"2026-08-05T19:39:48.055078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-06T23:46:49.824788Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-05T19:39:48.059765Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.059765Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:4f7e5fbbe918c988aba9b665face90e6f92420b07e28ab8c883c8e1933a4a1eb","observation_id":"f5b6ccda-328f-47e0-895c-d34039522811","resolution":{"observed_at":"2026-08-05T19:39:48.059765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-05T19:39:48.064324Z","title":"Mmicl: Empowering vision-language model with multi- modal in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.064324Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:26ecd1b99a2d6c5f800e896723b7ccdcf6915fd7f041ea0cfa33a73e723232db","observation_id":"dc0acddf-0452-4542-8916-34dbb5c29744","resolution":{"observed_at":"2026-08-05T19:39:48.064324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03149","last_updated":"2024-06-19T03:29:41Z","snapshot_observed_at":"2026-08-07T09:17:46.042178Z","submitted_at":"2024-01-06T07:54:58Z","title":"CaMML: Context-Aware Multimodal Learner for Large Models","version":3},"cited_work":{"arxiv_id":"2401.03149","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03149","snapshot_observed_at":"2026-08-05T19:39:48.633985Z","title":"CaMML: Context-Aware Multimodal Learner for Large Models","venue":"cs.CV","work_id":"6bea444f-1171-47f5-a4c2-007b2f21a629","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.069121Z"},"links":{"cited_paper":"/paper/2401.03149","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:06ed9f0860097dd9a1fa521e747ad693c87a24502750030a92692a9a66022e0e","observation_id":"16e4f698-fc0d-4b37-80d7-dc44182c46ea","resolution":{"observed_at":"2026-08-05T19:39:48.648811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.071827Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":"b725288a-6638-4ed2-9a1a-fe767613fdff","year":2015},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.078598Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:67731a0488c55a5289b6d323bdf4283a1a36c6ba42cd863da0e3a3e2ed02d9b2","observation_id":"8a816166-f40f-4779-b0a8-40d5702a3811","resolution":{"observed_at":"2026-08-05T19:39:49.075111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.058711Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":"acc68306-b917-46f3-9371-785d8f661d46","year":2014},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.082164Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:70f18ad41d62a62d85c83e497f3ced22b89289670ff107dcbe39b3a20e0d86b2","observation_id":"064f0dad-04c1-40ce-a4be-87c156d73b20","resolution":{"observed_at":"2026-08-05T19:39:49.062001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.045635Z","title":"Panoptic scene graph generation,","venue":null,"work_id":"baba79a8-62ff-49f5-a4eb-41a3815f2ab7","year":2022},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.087505Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:c9d41ca06d105b17f6d9ce9bac1a998f883bc78a94cafa083a977526bda2b74f","observation_id":"7da6b354-52cc-4587-a071-ef4c2aebda7c","resolution":{"observed_at":"2026-08-05T19:39:49.049397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.033783Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":"8768503b-7cb6-4364-84eb-0161db2c75db","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.092365Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:1d43bd971c2780912869232a75e4e7033a752c1b62e02f5fd36aa1c0538cad51","observation_id":"0f216edd-f8c6-4466-954b-3e5636654f35","resolution":{"observed_at":"2026-08-05T19:39:49.037852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.022606Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"b9760d6c-ad60-4c06-84c7-9454176be1d9","year":2002},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.097391Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:81126127dfb32175840b578a75e5d981490574b8c6209ff36e13898b5b96285e","observation_id":"2157a260-b549-480a-8763-0fa70a8c963e","resolution":{"observed_at":"2026-08-05T19:39:49.025900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.100736Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.100736Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:bd7cc4f8ee378a1f391d9177172bbf455e56cfc9e2761ce7ed73fc1b1f08f84f","observation_id":"56ae1682-2407-4411-8588-67915790807f","resolution":{"observed_at":"2026-08-05T19:39:48.100736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.001009Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":"85c5dca3-7ad5-4074-96fc-a878d77e3a71","year":2015},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.104232Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:6e7ad86e9296745d7f11ac508deb03a9fd0c573863224693b78e2ab1d1f506cc","observation_id":"d28d5f7c-fb8d-454a-a840-b822c9a5e598","resolution":{"observed_at":"2026-08-05T19:39:49.005462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.978880Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"7ecaf66f-2381-4cf3-b7fd-d488f218caf6","year":2016},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.108957Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:3cf3d8f561a0ea0196921911ee01b4f3a5d7b3ee01cc4639d095de157b020190","observation_id":"a41a9f92-bcd7-46f8-a4dd-f57476b6cbe9","resolution":{"observed_at":"2026-08-05T19:39:48.984661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.967935Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"91614829-dda8-438b-9fbd-fab33eceb1e1","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.113607Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:22741d6f29431118ee1ed29df50b3847f17197f99e16384ad5a5b8ae999f58cb","observation_id":"ba4e72e0-11cf-4a11-a933-129254c97da0","resolution":{"observed_at":"2026-08-05T19:39:48.971525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T19:39:48.121173Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.121173Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:79a69a0c930ea7cd3b82be105438943c968504bb6f73ad187f70a13a726c72fe","observation_id":"a70b2165-d355-46ca-91c3-e18b54b1079e","resolution":{"observed_at":"2026-08-05T19:39:48.121173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-05T19:39:48.124792Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.124792Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:4deab0b17bf9268c4f51c283710b6fb3db53ce8d06a041e962f59d3622be649f","observation_id":"069b9a4b-b512-452b-ab20-7cb3fc479039","resolution":{"observed_at":"2026-08-05T19:39:48.124792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-05T19:39:48.130365Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.130365Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:035b515e38d261c9486d526b81e5ba3ae22e79cb9ec077b5adfe9bff9fc2d1e8","observation_id":"4e50f82b-d859-4e4a-b256-471307846976","resolution":{"observed_at":"2026-08-05T19:39:48.130365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.954987Z","title":"Available: https://api.semanticscholar.org/CorpusID: 256390509","venue":null,"work_id":"d2dc745f-aad7-46fd-9891-f29a6a98e6e3","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.117178Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:440ca4626d6dff3d5d82b1ca728dd03d381dbf8d7f97912876bef2a475b1a5c3","observation_id":"5a10a371-7cdf-43c3-bbfa-86c72a2a00cc","resolution":{"observed_at":"2026-08-05T19:39:48.958837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.944051Z","title":"Mmict: Boosting multi-modal fine-tuning with in-context examples,","venue":null,"work_id":"c0566d9b-d398-494e-9517-983726b21a54","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.137165Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:345dcc757a633cc06b5f72a6db3e634ebfd73b4cec22b5353a79d7638fa8b643","observation_id":"f4621501-30fc-44ef-897a-3d9c6edede2f","resolution":{"observed_at":"2026-08-05T19:39:48.948011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.932054Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":"e82e0767-29e7-4e7f-8210-d857d2f9eec0","year":2022},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.140247Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:3d135e8291303126a8e8bd6bcf9f1b6c22422c791a1bc8efba9db876122ea2f7","observation_id":"5ed4d786-02e6-4e98-bbb7-f525b886ef24","resolution":{"observed_at":"2026-08-05T19:39:48.936899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.909239Z","title":"Cantor: Inspiring multimodal chain- of-thought of mllm,","venue":null,"work_id":"c5ff6cf8-d5e4-4c15-adf1-d5854251d340","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.144298Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:add6b77d4a60d2bd3ddcfec9717303b2b5429fb3722efc6ce74d9a79ddda6f0c","observation_id":"ac638776-fc03-48f3-85c0-9b918924fde1","resolution":{"observed_at":"2026-08-05T19:39:48.916037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16198","last_updated":"2024-07-23T06:02:30Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T06:02:30Z","title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2407.16198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.16198","snapshot_observed_at":"2026-08-05T19:39:48.560151Z","title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","venue":"cs.CV","work_id":"cb8b9fe3-034a-4fd0-9617-3b226d3abe3f","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.133771Z"},"links":{"cited_paper":"/paper/2407.16198","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:bfc41cd4bd5db0350df56e21068f10eccbcca48a77182f0a7df391da668ab661","observation_id":"5a2cff7f-f92a-4cfd-9d31-a79215644a5a","resolution":{"observed_at":"2026-08-05T19:39:48.570485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.871162Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":"683ba577-ca7c-49e4-87a6-44b9332d58b2","year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.159498Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:20765584429d738c2b0262863a7d6e6b6068d5eb8df336bf98bcaa2c4cfaf675","observation_id":"2fcc1d4d-6c3a-42db-a9a9-0668919903c7","resolution":{"observed_at":"2026-08-05T19:39:48.874397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.163553Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.163553Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:a92a9e845daed3877282f3d9f4fc626a8dd4d89c37eb14b250b33f342e7979be","observation_id":"cf21f313-22a6-403a-b487-4054478e175c","resolution":{"observed_at":"2026-08-05T19:39:48.163553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T19:39:48.167701Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.167701Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:97ed67689acb1ae62a22c53b4bc9a22c2c5cf14e75badf9e937becb0347b85dd","observation_id":"ec322ad7-3d90-4a70-ac13-c2e78f070e97","resolution":{"observed_at":"2026-08-05T19:39:48.167701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.898907Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":"7060ca09-8634-43ec-894a-133bf0065ce7","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.149659Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:e306537f151d542866ce436ea040a8806467ec3e23f981cbd24034fc04cffcb2","observation_id":"c4866031-3d7d-46ce-968e-a6d1cb721dd1","resolution":{"observed_at":"2026-08-05T19:39:48.902281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.885286Z","title":"Available: https://api.semanticscholar.org/CorpusID: 265281544","venue":null,"work_id":"a7c3da65-9e76-4618-90b7-f49dd5ec14c4","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.153196Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:91e0ebd1e945354f7ea94dabe37663e983da679cdeb5f88b610d86bf1365631a","observation_id":"c0506359-bb7d-41f3-a44d-c2e962694888","resolution":{"observed_at":"2026-08-05T19:39:48.888958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.829489Z","title":"Manipllm: Embodied multimodal large language model for object-centric robotic manipulation,","venue":null,"work_id":"44cfe7eb-515d-4254-90c3-ec2cd8e51a3b","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.181046Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:549e0ed65ff4cd5fffbd0ee4563cecb8d7028bf6a75afa26a8c4ce6af4534702","observation_id":"66411ede-fb32-46f8-9fc1-6074fe3a8c78","resolution":{"observed_at":"2026-08-05T19:39:48.834882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.798967Z","title":"Rap: Retrieval-augmented personalization for multimodal large language models,","venue":null,"work_id":"dee274eb-efd4-42c7-8f71-cca7faebbdaa","year":2025},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.188905Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:b359f6c5582610bfc1165196fc8354da310f867f22433c1d8346ed95480b7376","observation_id":"7d7eda24-ed12-4dfe-90c5-206349a46147","resolution":{"observed_at":"2026-08-05T19:39:48.804984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.786897Z","title":"Yo’llava: Your personalized language and vision assistant,","venue":null,"work_id":"2ff97a55-ec18-41e9-b6ca-3276e4a47977","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.191574Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:9db66ed0d8f894cfc660595dc3fb8bb613a83f17421376eeb1bd62f93d7ce7fa","observation_id":"863d828b-bcf9-4ba0-af2f-ac13b716c004","resolution":{"observed_at":"2026-08-05T19:39:48.790306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.858465Z","title":"Jm3d & jm3d- llm: Elevating 3d representation with joint multi-modal cues,","venue":null,"work_id":"d98b7435-6b09-48eb-9fd3-ec02ccd179fd","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.171506Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:522226b854f36ce5cbbd33bc6237dc9ca87401e21151786b6df36c1f6c10a91a","observation_id":"db9dc312-26fa-4102-9fae-f82b7ab730a3","resolution":{"observed_at":"2026-08-05T19:39:48.861748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.846322Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":"b9114385-70d4-459f-8bf4-9455f1e61f3a","year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.176293Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:3569e2d54b60780c4ee125b678548e2ded16e7b49423449103b74f983bdd53cb","observation_id":"2631a3bc-7b7e-4b32-bb7d-bb594ec41218","resolution":{"observed_at":"2026-08-05T19:39:48.850483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.207295Z","title":"Llm2clip: Powerful language model unlock richer visual representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.207295Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:3f3fc5bd21b44731b08bdbc4594b1873fb7baf4dc2a4f1ae0a93a9d29bc7c38d","observation_id":"36873bb4-dd1a-45ee-940a-2d65d5c98aa0","resolution":{"observed_at":"2026-08-05T19:39:48.207295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.815511Z","title":"Available: https://api.semanticscholar.org/CorpusID: 266573457","venue":null,"work_id":"d639d321-8ae8-4f20-b244-06fbc929daaf","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.185416Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:d00939f11abcca8dac26bf40523c60015f22317b592e01edccf63ab37d13a5be","observation_id":"0ae8dd8e-75a3-4d8d-9bc0-668bf4a658cd","resolution":{"observed_at":"2026-08-05T19:39:48.819456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T19:39:48.214532Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.214532Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:3cc0443b9bc37d76becc000c000c5e653ac0c0c14e86f21438f8cb480d169d7f","observation_id":"5f8819b5-6c47-44eb-a65c-fbf2719e09ef","resolution":{"observed_at":"2026-08-05T19:39:48.214532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T19:39:48.225203Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.225203Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:bdae87856bfd9baa6eaf525f7c4a60395d52f9e9f7d235396b4cc4897eaec480","observation_id":"ea84cffa-cf95-4d85-b959-fcb037b10bb2","resolution":{"observed_at":"2026-08-05T19:39:48.225203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.774330Z","title":"Myvlm: Personalizing vlms for user-specific queries,","venue":null,"work_id":"e78b9525-b6f2-4455-ae04-07627a158937","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.198688Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:1491ba11e8b4dfa66ec925a5e8526d55e2891b4d75e8be47674d41d6914248d6","observation_id":"06819efa-51cd-4240-b180-13c4f8121ed3","resolution":{"observed_at":"2026-08-05T19:39:48.778005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T19:39:48.202916Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.202916Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:efcf1bc0504c630c884839792667be093535ce776ea8364f52778f29fb6821c6","observation_id":"5e8108fc-7083-4939-85cd-9dcfe042a13d","resolution":{"observed_at":"2026-08-05T19:39:48.202916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T19:39:48.237682Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.237682Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:1de815a8eeb52f3162af632d082418ba5de59b6afca6e89b95627efa4be0a0f0","observation_id":"80b1a083-761c-416a-9ece-e9b080dc6912","resolution":{"observed_at":"2026-08-05T19:39:48.237682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.762945Z","title":"Gemini 2.0: A new era of multimodal models,","venue":null,"work_id":"745b4d90-3501-4c00-9793-c0cb6f1d192a","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.210718Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:8045dd4a834d5127de338553ca4b783cc71b213443c30f4ac17289301ce385ed","observation_id":"aacd94b3-7518-4400-b327-feb67497b463","resolution":{"observed_at":"2026-08-05T19:39:48.766616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T19:39:48.245781Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.245781Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:c76854ce09d09a559fccbf2f03a1d4e0d82e0962ac6c03767bf1452257ba4b42","observation_id":"7a31e000-7b9a-412b-9ce5-ab7d02769624","resolution":{"observed_at":"2026-08-05T19:39:48.245781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:48.752879Z","title":"Intern vl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"c3012ea8-f1ef-4a10-a302-73a8b59c52ae","year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.229795Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:4462b0d139ab2348125a133404dc63efa036a3446bf6adb7415e9c4f4730dd13","observation_id":"7caa56f4-8a90-467c-939b-7101d79bffb0","resolution":{"observed_at":"2026-08-05T19:39:48.756620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T19:39:48.233486Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.233486Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:a089862a69ae899e62e37bacf969a0f35b806d16ba0c575f82e017ed1108bfe8","observation_id":"5f8d553e-db90-487d-b911-114ff3e7f983","resolution":{"observed_at":"2026-08-05T19:39:48.233486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14627","last_updated":"2023-10-31T15:04:35Z","snapshot_observed_at":"2026-08-07T16:43:54.797998Z","submitted_at":"2023-05-24T01:53:49Z","title":"Enabling Large Language Models to Generate Text with Citations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14627","snapshot_observed_at":"2026-08-05T19:39:48.241070Z","title":"Enabling large language models to generate text with citations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.241070Z"},"links":{"cited_paper":"/paper/2305.14627","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:19919bc8b7566c4f1ea0563ef6cfb521e8468e5a079096f8eec673d8652771ca","observation_id":"eb47bbe7-f3a4-47da-b8e7-ab3b418008ce","resolution":{"observed_at":"2026-08-05T19:39:48.241070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.219279Z","title":"Available: https://api.semanticscholar.org/CorpusID: 248476411","venue":null,"work_id":"3b6bc00d-e786-4bcc-8920-8ce90c8a6a1c","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.037500Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:7f97d1fa539a9ea5c10cf2415095a2e3cd76f292eb3c67b81a254639e27ac1b0","observation_id":"be0e5648-70cf-4467-88ea-e2d6934d2848","resolution":{"observed_at":"2026-08-05T19:39:49.242414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.140829Z","title":"Available: https://api.semanticscholar.org/CorpusID: 258615266","venue":null,"work_id":"e757e319-b285-4424-8910-98584df1510e","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.052310Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:e6913ec9c6b98fd9aaf941da03516a1f32272028d0e0a2a4251b8f11cae58da0","observation_id":"af0d61fe-6251-47e2-b377-ccfecb726f3d","resolution":{"observed_at":"2026-08-05T19:39:49.168952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:39:49.085930Z","title":"Available: https://api.semanticscholar.org/CorpusID: 266844925","venue":null,"work_id":"c887f798-e8a5-4ec6-84ce-e7b340b8a43c","year":null},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.074850Z"},"links":{"citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:d7d3fb641065486aa5a831169dd03ac49e690fe3177ba64436fd69f155d77229","observation_id":"eba9c55e-cb75-44ff-adae-69bb5301e5f3","resolution":{"observed_at":"2026-08-05T19:39:49.110845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2508.12263."}