{"as_of":"2026-08-19T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99e73d742f1ce79fccfd79c7c8451a5a6a11fa32f751f8eec05d3a1019b02d7c","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:53:23.309664Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:55:17.207198Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T20:33:17.140335Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19627","snapshot_observed_at":"2026-08-11T04:55:17.207198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.18277","last_updated":"2025-08-04T02:46:55Z","snapshot_observed_at":"2026-08-18T13:42:14.970744Z","submitted_at":"2024-12-24T08:38:35Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:55:17.207198Z"},"links":{"cited_paper":"/paper/2504.19627","citing_paper":"/paper/2412.18277"},"observation_digest":"sha256:7fedb53ec7a2b07fa70479acf01b4de357b57f78856ebe7098d64b675e922d31","observation_id":"0a048ce3-2f65-47d8-9e99-1a2d10ec34de","resolution":{"observed_at":"2026-08-11T04:55:17.207198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2504.19627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49589827-72f3-4fbe-a77d-ad523cb6f85f","year":2025},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2504.19627","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:122f55e198c9d2ce652bf71f6afda056c71b8c3fbee0dab1f2911a42f18c635f","observation_id":"439f993c-bf43-46df-ab72-58020bbae29a","resolution":{"observed_at":"2026-05-13T20:33:17.141525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2504.19627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49589827-72f3-4fbe-a77d-ad523cb6f85f","year":2025},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-08-11T10:41:47.822598Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2504.19627","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:b8e3c44c646872dd6f35b00616c29c57079801133af6805b6a1f5ab7a8cfd144","observation_id":"977f4470-facd-449e-89d1-1b2e24913411","resolution":{"observed_at":"2026-05-11T11:31:01.611015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19627/citation-record","integrity":"/paper/2504.19627/integrity","json":"/paper/2504.19627/citation-record.json","paper":"/paper/2504.19627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.013678Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.013678Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:31bc4cb89ae772fd98fb34ee81bd059e609d3fbf2d25ab5b423434710a7e8b2e","observation_id":"7cb46e91-eb48-41c7-92c8-bfa397199e3c","resolution":{"observed_at":"2026-08-16T05:53:23.013678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T05:53:23.018475Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.018475Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:c3340baf2ecb99bf20d7b7c0d3e17bf7975d4c74dec9283cda28d5887bb67ce2","observation_id":"5d0a56a5-64e3-4ac9-9108-80443222eaad","resolution":{"observed_at":"2026-08-16T05:53:23.018475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.023000Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.023000Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:2b9d83ee6fb7aed79cfa3b2453253369fe97ecf9b1118013364306fd6604f004","observation_id":"0ed35da3-db7b-464c-8295-5a5d6a813147","resolution":{"observed_at":"2026-08-16T05:53:23.023000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15232","last_updated":"2025-03-08T05:29:51Z","snapshot_observed_at":"2026-08-18T03:58:48.807902Z","submitted_at":"2024-05-24T05:46:04Z","title":"DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15232","snapshot_observed_at":"2026-08-16T05:53:23.026924Z","title":"Deem: Diffusion models serve as the eyes of large language models for image perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.026924Z"},"links":{"cited_paper":"/paper/2405.15232","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:f2fb4fb9368032d0c3fb610ebb3ee118b7df38bd074625053861918d926298cf","observation_id":"a46b5166-1d76-433f-81d2-8e62119b7875","resolution":{"observed_at":"2026-08-16T05:53:23.026924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.861186Z","title":"Few-shot adversarial prompt learning on vision-language models","venue":null,"work_id":"f22eb7d5-47ce-4f35-bb6b-535a9e4affaa","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.035776Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:6ade6965ed13bdcc1f0567bc95c00286fab13d7c4ce275f1af2507f668ef4b57","observation_id":"fbc81211-1750-476d-8e3f-b3e45b621b85","resolution":{"observed_at":"2026-08-16T05:53:24.865303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-16T05:53:23.043813Z","title":"A survey on vision-language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.043813Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:d4ab948d394f8babcf74a4b2e35fc492b39c13001b19672e1ddaa61dc56bd1e7","observation_id":"60a87125-fb5b-40e8-8166-923489bf0d4d","resolution":{"observed_at":"2026-08-16T05:53:23.043813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05756","last_updated":"2024-06-09T12:23:14Z","snapshot_observed_at":"2026-08-18T13:29:44.835199Z","submitted_at":"2024-06-09T12:23:14Z","title":"EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05756","snapshot_observed_at":"2026-08-16T05:53:23.047792Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.047792Z"},"links":{"cited_paper":"/paper/2406.05756","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:82f34c9b9f4e73876daa1bb6f7b60985ae8ff051b9a6a83843d26f209863764a","observation_id":"baa2b6f0-fd0b-41c6-8443-d1caefe4f41c","resolution":{"observed_at":"2026-08-16T05:53:23.047792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-16T05:53:23.051893Z","title":"Senna: Bridging large vision-language models and end-to-end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.051893Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:3579e458b26a868267629b4de6136745c9dbdcfe50c0d3fa1912cb3c1ed74cae","observation_id":"5de1d7e7-ffa3-488e-a6d6-0523a92297a5","resolution":{"observed_at":"2026-08-16T05:53:23.051893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.850420Z","title":"Large (vision) language models for autonomous vehicles: Current trends and future directions","venue":null,"work_id":"2114e992-81ee-4a9b-816e-a4b5da925bc6","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.055858Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:8a4882ccf208d01965444575614eacb5f52b0c2edd230fe5a7286e71659b5266","observation_id":"184d4616-edd7-4750-abc0-a424deda5c62","resolution":{"observed_at":"2026-08-16T05:53:24.854388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-16T05:53:23.063240Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.063240Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:b73ca9dda44e41a932cb6d5fbea593ef5bf1cc924d5a6c9e760a2ac5a2ebd7a3","observation_id":"125a7038-da91-4d41-a57d-fb0b32f86c6c","resolution":{"observed_at":"2026-08-16T05:53:23.063240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.067210Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.067210Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:68fc8feaa6c14778130df66ee795930edf86cd857d7d30c6ecab2ea34a215585","observation_id":"1772d2af-35bf-481c-8085-05657b88811c","resolution":{"observed_at":"2026-08-16T05:53:23.067210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.071287Z","title":"Dynamic programming","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.071287Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:fabb85e806ce710a71287e85f81b43ec70d43c794ed899e37a1c74015fdde423","observation_id":"26ca3679-d3c8-4375-a3f7-70c225e2e1b7","resolution":{"observed_at":"2026-08-16T05:53:23.071287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.075009Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.075009Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:5f7cdbc7df40dc677f100a5e4cd58b852860fd6bd21df30ac4662ad8493ea9b4","observation_id":"c42cde95-d287-4bba-95b6-27f6b109b870","resolution":{"observed_at":"2026-08-16T05:53:23.075009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.824514Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"af7dc824-7ae3-496a-a3c5-336b09c67c30","year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.078596Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:dc90c14620836305e24e49869a48be4f2d6448839b77834defabe12b365c669a","observation_id":"a075c2cb-a895-4cf8-9bc6-9aa595b1b141","resolution":{"observed_at":"2026-08-16T05:53:24.829070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.082634Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.082634Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:5a7c74995c1c8cd8c432898da58bc41101b9695e4bc06d2e17780f446532ca94","observation_id":"7d9b35f5-293f-426b-8548-5c0c2b443443","resolution":{"observed_at":"2026-08-16T05:53:23.082634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.086330Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.086330Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:0756bffd57ff604ec8fe2e9ff512d7b9177ac6bdf00068232286983c929d6d05","observation_id":"f4d6ef1b-882b-4b0b-87bc-3abfec4fbdcd","resolution":{"observed_at":"2026-08-16T05:53:23.086330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.799311Z","title":"Gqa: A new dataset for real-world visual reasoning and composi- tional question answering","venue":null,"work_id":"18442f4a-1453-4e7c-88c6-d1ba63ae9a6c","year":2019},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.090053Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:3832a4938af8bedd66d88856f36f789e66d605aacf1a0d13a8cd865c91a491d5","observation_id":"43d2e9e3-b84b-48b8-8a2e-2ced21a70350","resolution":{"observed_at":"2026-08-16T05:53:24.803885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.787750Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"06e409c8-09bc-4c7f-843b-ac47a79dcc3f","year":2018},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.093515Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:38665e3d0f6d8af93965fc08db3b760ffe269f69dadd4cd27d8e5c000398412b","observation_id":"02ad6099-06b8-4e66-92c6-7d783010e01c","resolution":{"observed_at":"2026-08-16T05:53:24.791621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.096850Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.096850Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:58828031010c9baaf7853511fbd3fa978360a0c0b1cf37f0a1e743b056dc06bd","observation_id":"6693ca22-460b-4a02-81ca-90555dfdac53","resolution":{"observed_at":"2026-08-16T05:53:23.096850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-16T05:53:23.100232Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.100232Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:76a881328219a6e2db8de981471f4f8a734169a912f10d8e47368f7d715921e0","observation_id":"8450252e-628c-4c77-8088-d01c3aa7a2fc","resolution":{"observed_at":"2026-08-16T05:53:23.100232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T05:53:23.103779Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.103779Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:22847b9345574d0e7eb57d5b9f3813064360e6783def63d57f9a16d869355e96","observation_id":"ee254508-bd9d-41b0-91c0-40ef0f8af08a","resolution":{"observed_at":"2026-08-16T05:53:23.103779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T05:53:23.107383Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.107383Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:a8d48ebc57a51395140335f1ba037745d446753b0b74ec2d823fb6165f0fa097","observation_id":"4b74c2ad-5b6b-43bf-8c90-301577ca761d","resolution":{"observed_at":"2026-08-16T05:53:23.107383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-16T05:53:23.111130Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.111130Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:90ba25586179af72ad6aa8086d2ae37aa26008ba0d85a97e3ea3b2fd4d8db03a","observation_id":"dc96e961-9e3e-4580-8239-753428c6f52c","resolution":{"observed_at":"2026-08-16T05:53:23.111130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-16T05:53:23.114832Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.114832Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:f492804dbd2e917fa7b64041612c20e3162199fef95fdf6d506e6efb3946c5df","observation_id":"4323062e-8326-4835-8bdc-a0f6384cacdc","resolution":{"observed_at":"2026-08-16T05:53:23.114832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.118315Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.118315Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:c49e6bf70dc0a3a4a836addd3c90da95460b61ff277270987495e4340aef9690","observation_id":"ba6e66c1-2206-4e77-b54b-0f8353a4c00c","resolution":{"observed_at":"2026-08-16T05:53:23.118315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-16T05:53:23.121996Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.121996Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:286bea2a14ba7d6d176a6839eb18137610d0134876f877a56b0648953002d853","observation_id":"5a874e4c-c043-42d0-b833-9300175f110c","resolution":{"observed_at":"2026-08-16T05:53:23.121996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.125737Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.125737Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:6322f0503e122c60352e4470b35d2d3aba40b2099ac9c9106a8ebad9fedc23a5","observation_id":"d3a8dab6-9012-4923-9ab5-e5fc7f5b2c6b","resolution":{"observed_at":"2026-08-16T05:53:23.125737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-16T05:53:23.129212Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.129212Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:656e3182c0cbfed87aff3b60ba0763ab314cd8c83b40e1ec536c1de832d5ca98","observation_id":"ddfe012d-c71c-4bea-88d1-5f697d078454","resolution":{"observed_at":"2026-08-16T05:53:23.129212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.615158Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"4097290e-7b26-442e-a89e-d79b6aba5c2d","year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.132835Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:bf94b11506178e20c42ba7c7a36991c8d169317cad6ead3dd0615a42bdb3efa5","observation_id":"a4676939-ae01-466d-b42d-5fe864d31a36","resolution":{"observed_at":"2026-08-16T05:53:24.697737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.136470Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.136470Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:250f384d0704c12ab99579f63425bef37ece83bd3f1c2c15421d76988d2be6e7","observation_id":"5c55bf5d-da0f-46bd-99c0-70085a01d317","resolution":{"observed_at":"2026-08-16T05:53:23.136470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.497366Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"e7f11a3d-6db8-4f99-9197-0c45871a178e","year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.140146Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:bfa77a6e53ce6e2f11dbdf283322eb74020a8250ef507f3bb5593f7071c09031","observation_id":"6f8696bc-7c0d-4266-b273-86b86cc46560","resolution":{"observed_at":"2026-08-16T05:53:24.567173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.410316Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"ced43e79-376e-477f-9bbc-9e67db00ee77","year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.143671Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:651362965251b62a6acf55d77359eaf3594f6ca30ffbd0f4ee1082fb5f46c8ab","observation_id":"c4945215-6adc-48d7-86dd-8a006d541023","resolution":{"observed_at":"2026-08-16T05:53:24.422819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.147269Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.147269Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:bbbe114c52659fc664ef33d7c1614f08b7e0a1514be3993f8ee5fa971642cdb8","observation_id":"8cdabcd1-5c12-471b-a3ea-9b5ddd5cfc3d","resolution":{"observed_at":"2026-08-16T05:53:23.147269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.150698Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.150698Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:604fde6fbe28f1398eed65435df03416877247437f3bbc072011ffea69140766","observation_id":"01aa8a78-92ef-4483-9c31-afa32bc6a364","resolution":{"observed_at":"2026-08-16T05:53:23.150698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T05:53:23.153965Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.153965Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:448c4bf2f05cab2e1751ef3f4322f312a21ee67b5f53e9940c6f8b4bb2d4fa63","observation_id":"044bf9ca-59f7-4e07-be48-3c46853525af","resolution":{"observed_at":"2026-08-16T05:53:23.153965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T05:53:23.157826Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.157826Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:bdc73730ba1f8cd9b2a9f27b2f465b8130964d4dfa1fd5f4e8cdff104c026e5d","observation_id":"4950edca-f73c-49f4-8e3e-2c4f31b950b5","resolution":{"observed_at":"2026-08-16T05:53:23.157826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.385996Z","title":"Least squares quantization in pcm","venue":null,"work_id":"e1bd32bc-0e3c-4cf0-8c11-207430e0f00b","year":1982},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.161487Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:e58e75a82dabfb1837d2504649582ef2d15f6f2c11d9065a7c697f108b1300b7","observation_id":"398a39d2-4839-4375-a88f-c193ae587840","resolution":{"observed_at":"2026-08-16T05:53:24.390410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.374679Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6bd30fc2-7bf1-4a80-a16f-a7ca62057d81","year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.165006Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:b88ebaba0b882e4eec33559bd72fe11a64cbe1864876b4bffa3c7619f120891d","observation_id":"194cc1a1-ea3f-4f64-815e-13847a58483c","resolution":{"observed_at":"2026-08-16T05:53:24.378541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.361671Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model","venue":null,"work_id":"7a931904-9f38-4bcd-8367-a170137baf5e","year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.169026Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:69d128a8a512e785cd186f88e92337612dd8f60bc702143d26a86f1a3fae8108","observation_id":"66aca493-689b-4178-a5f0-76f29e2a6b29","resolution":{"observed_at":"2026-08-16T05:53:24.366329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-16T05:53:23.172405Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.172405Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:e003259ef1830b82243a179e37114c2787a4c04cb58a346c0e728cd87833dd45","observation_id":"3afc06f7-f63c-46b3-98ea-f3831861130c","resolution":{"observed_at":"2026-08-16T05:53:23.172405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-18T18:37:49.349707Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-16T05:53:23.176102Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.176102Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:4efbbc18681ac3b308d8490f0cc3f40650c2e7f7f696ea3448e61cd8f4080ba7","observation_id":"4f7d9831-2036-445d-acc1-bd80ebf19868","resolution":{"observed_at":"2026-08-16T05:53:23.176102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.180051Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.180051Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:7c8a71567b4642e85e28d74d9f423ff3f9869d3e2b363bcf4a6147bc79ea33e5","observation_id":"8166c230-2559-4498-8429-5b800357ffea","resolution":{"observed_at":"2026-08-16T05:53:23.180051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-16T05:53:23.183611Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.183611Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:7763de16653b0afc89610a0864dc36708fdcfd63a26153434044e4a08a2f6043","observation_id":"451a1e11-31fe-4c0f-83fc-853e607e4a7b","resolution":{"observed_at":"2026-08-16T05:53:23.183611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.221356Z","title":"Panoptic segmentation","venue":null,"work_id":"43ab0ab7-6633-4e6a-a549-7a3841d856c9","year":2019},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.187798Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:9dd0ec2a0c7f18ad012719e59042ed94ed399c2596d573af972d4b20d55147b2","observation_id":"c3a7d57e-628c-45f2-ba7e-df93e34d1504","resolution":{"observed_at":"2026-08-16T05:53:24.276606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.096766Z","title":"Mask r-cnn","venue":null,"work_id":"54ff31fa-dcad-413f-b490-5cc124aee6cd","year":2017},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.191714Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:aa2f1640c551e4aec9e082b44e0602694e5af393d90c738e2445a63e0ef79311","observation_id":"a1974b4d-306f-4158-90b9-7e4745b1e338","resolution":{"observed_at":"2026-08-16T05:53:24.139140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:24.001897Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"f0e7d28b-6f92-4423-81e2-c79dc98ab920","year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.195408Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:1516dcb3c08f4a85ad2be813b5ab254ecb6cdcf29f36b1d77a626bc143126376","observation_id":"866ae55b-0eaf-4502-89f1-0875fa44cfcb","resolution":{"observed_at":"2026-08-16T05:53:24.022353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-16T16:27:46.006186Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-16T05:53:23.199481Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.199481Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:a928c99b4ffa09f800892b550f78cf9a72627e78d3265b55e4545daf0a617775","observation_id":"59ae4213-c261-4822-8aee-818be2a1d7a7","resolution":{"observed_at":"2026-08-16T05:53:23.199481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.990326Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"54ed1f40-657a-4385-8bf1-18aab4532d09","year":2018},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.203621Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:831e0a7a6d833d69a4292a87bc15b0ca3cb7918b9ab6425126d666f03fd5e37c","observation_id":"b57d74d1-f250-4cce-987a-fce997094e50","resolution":{"observed_at":"2026-08-16T05:53:23.994302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.978356Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":"9a58b677-5ffb-456b-9edf-93e10f4b1222","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.207203Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:1dd150e929aa78e61dbb7cef2b4a0243f75fde1127fd089db6081d42b6a9c701","observation_id":"5629e619-316f-4b4f-8320-a1d254c3f395","resolution":{"observed_at":"2026-08-16T05:53:23.982575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-16T05:53:23.210832Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.210832Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:37d3b70900b9cefdc6edf1279400521efd4bb4103690607a09ffa823a21f8734","observation_id":"65787873-357b-40aa-86f2-0de5a299b0ab","resolution":{"observed_at":"2026-08-16T05:53:23.210832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-16T05:53:23.214627Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.214627Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:b524b9139d87426d024c8f1cab569132582f96490e894e264d09c7250b544e33","observation_id":"a9d839f0-6ec9-4250-8664-a2eeb962113c","resolution":{"observed_at":"2026-08-16T05:53:23.214627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00654","last_updated":"2025-04-01T11:07:19Z","snapshot_observed_at":"2026-08-16T12:44:59.583870Z","submitted_at":"2025-04-01T11:07:19Z","title":"QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA","version":1},"cited_work":{"arxiv_id":"2504.00654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.00654","snapshot_observed_at":"2026-08-16T05:53:23.424972Z","title":"QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA","venue":"cs.CV","work_id":"e193d2eb-a764-4ef2-a5e7-ee88820c9c29","year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.218705Z"},"links":{"cited_paper":"/paper/2504.00654","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:99822ddf67456f6bebad849f99ff9e4bc8f02ab32786e54adae591f3e4a1e739","observation_id":"827f4e3a-4921-4742-850b-2ed579237af7","resolution":{"observed_at":"2026-08-16T05:53:23.431195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16036","last_updated":"2025-03-20T11:09:18Z","snapshot_observed_at":"2026-08-16T12:48:19.282885Z","submitted_at":"2025-03-20T11:09:18Z","title":"Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16036","snapshot_observed_at":"2026-08-16T05:53:23.222499Z","title":"Hybrid-level instruction injection for video token compression in multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.222499Z"},"links":{"cited_paper":"/paper/2503.16036","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:97d813f401e0d54511d42f65db5b90e9d974a76e59d0730498dba6b88c02df5b","observation_id":"a996f7f8-2fca-4bad-abdc-7b3b162d9d90","resolution":{"observed_at":"2026-08-16T05:53:23.222499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-16T05:53:23.226484Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.226484Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:aab2df999198039534a7237a269c5adbec2713a3d905b64ada8fb982019654c1","observation_id":"36dc7495-b72b-4676-9c79-17a83e1ba0e0","resolution":{"observed_at":"2026-08-16T05:53:23.226484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.964094Z","title":"Efficient large multi-modal models via visual context compression","venue":null,"work_id":"ce1b8698-e4db-473e-b82a-76d114357b05","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.230431Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:13d8b8a3c43f484a173e3bd0f6c44eef6c69e201d6d2da9a72d80b8469d1c2d4","observation_id":"d2a58e83-7e7c-489e-a5e7-d95904f35d84","resolution":{"observed_at":"2026-08-16T05:53:23.970400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-08-16T13:48:07.615752Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-08-16T05:53:23.233834Z","title":"Matryoshka query transformer for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.233834Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:99726492e9578d97e841fe55c818bf67d645e8ac865c52747796746d1550cd8e","observation_id":"4b6e855d-f0e3-4462-937c-2e3a7a51e4be","resolution":{"observed_at":"2026-08-16T05:53:23.233834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05840","last_updated":"2024-12-31T14:46:47Z","snapshot_observed_at":"2026-08-18T23:26:14.902567Z","submitted_at":"2024-09-09T17:44:00Z","title":"MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05840","snapshot_observed_at":"2026-08-16T05:53:23.237184Z","title":"Mmevol: Empowering multimodal large language models with evol-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.237184Z"},"links":{"cited_paper":"/paper/2409.05840","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:26f25f13e3031ebe8794f744d99bbd68f71cc4a476dcc079e44ebca288db6fe5","observation_id":"c971ad23-f87b-4597-ab6f-bc2d6d00ccfe","resolution":{"observed_at":"2026-08-16T05:53:23.237184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-16T05:53:23.240784Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.240784Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:d0d277dc720e40b460cad61a99a5428d4746de05ef3310681f18109a4e6005ce","observation_id":"a5618281-9002-4cab-8243-002686e3ef42","resolution":{"observed_at":"2026-08-16T05:53:23.240784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.947638Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model","venue":null,"work_id":"12505b8b-4ebf-405f-96f0-931c1b6a28f4","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.244004Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:f0894a19e7d587b87f15795475e5e2d35046c3c4b4554f6be7f87d993977b150","observation_id":"d554a7df-a338-4878-9613-608e0b47a067","resolution":{"observed_at":"2026-08-16T05:53:23.955745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.932271Z","title":"Distilling large vision-language model with out-of-distribution generalizability","venue":null,"work_id":"1c93164e-8dbd-4559-8ea8-b051e7806b61","year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.247576Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:613ea9ef653acc61d1e90ed55aa56201a91d1060e08350c38c447c4fc4ea5c01","observation_id":"94c4da0a-b7a8-4151-9222-30312bdfe980","resolution":{"observed_at":"2026-08-16T05:53:23.936213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.920186Z","title":"Rs5m and georsclip: A large scale vision-language dataset and a large vision-language model for remote sensing","venue":null,"work_id":"9c8aa920-a01c-46d0-967d-a905e2c028d7","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.251000Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:dc412a8e892e8e267121af347db48422108d8c04d3952edf5b1266fd607f160b","observation_id":"973a8408-6289-41b6-b827-0f546a63f4da","resolution":{"observed_at":"2026-08-16T05:53:23.924090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11574","last_updated":"2024-02-18T12:43:38Z","snapshot_observed_at":"2026-08-16T14:17:36.905874Z","submitted_at":"2024-02-18T12:43:38Z","title":"Visual In-Context Learning for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11574","snapshot_observed_at":"2026-08-16T05:53:23.254383Z","title":"Visual in-context learning for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.254383Z"},"links":{"cited_paper":"/paper/2402.11574","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:6f0890cb53c59bfc569a7d5b5a8ce307d2a9f511b2918c120f60b6d3ac438f0c","observation_id":"1b76abfe-60ab-43d3-b62d-8f531ea618e4","resolution":{"observed_at":"2026-08-16T05:53:23.254383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.907969Z","title":"Anomalygpt: Detecting industrial anomalies using large vision-language models","venue":null,"work_id":"959ef7d2-5a6b-4a59-8dfa-76a9ef685feb","year":1932},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.257827Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:518207cbd552d5f8af66fb3d8c502ccfb1cd04951187181fc5df7b646a19442f","observation_id":"2801aa98-1897-4871-94ba-0997556ae668","resolution":{"observed_at":"2026-08-16T05:53:23.912006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.896545Z","title":"Matryoshka query transformer for large vision-language models","venue":null,"work_id":"42a8fc1b-d4c4-43ad-8606-4012135ba3aa","year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.261043Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:699eeb1f22cdf3743b410ce71659f8b81e9afa86bd04b60e3c20fc181d979b51","observation_id":"1a0b1ba4-5a23-418e-8f31-8278e8dcf93f","resolution":{"observed_at":"2026-08-16T05:53:23.900177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.885011Z","title":"Pyramidclip: Hierarchical feature alignment for vision-language model pretraining","venue":null,"work_id":"bf04da61-9393-461f-b8a8-f3dd029a4915","year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.263859Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:8a6bd51eec6fb8e1fd4f6816e91ef1bb238be05ab1403426530899e762d5b253","observation_id":"787510c3-31c8-4478-bb6e-001b07875047","resolution":{"observed_at":"2026-08-16T05:53:23.889111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.872574Z","title":"Matryoshka multimodal models","venue":null,"work_id":"fead0378-d35c-4ae3-bb87-1effb28e2916","year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.267730Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:a276ff956af70229ccfe0840d621cbf540f8d0bc5f761c41517012d8efc8e6e9","observation_id":"3421e68b-421d-4b70-9fbe-95152307f7ad","resolution":{"observed_at":"2026-08-16T05:53:23.877145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T05:53:23.271111Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.271111Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:a1a4bd5f5de94181096bbb962ec9e1e5d2aecc3f6f285823e48583f12a509bc5","observation_id":"7ea3ea87-15dd-47b0-8c9a-030b198b93c0","resolution":{"observed_at":"2026-08-16T05:53:23.271111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-18T18:23:18.371488Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-16T05:53:23.274389Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.274389Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:e9c0a00ac921669230fb61a6489b731995562c5ec352a19f13d582f8fe1784a5","observation_id":"c0515a80-6d45-40ff-90d7-e42ade2f7460","resolution":{"observed_at":"2026-08-16T05:53:23.274389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.278220Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.278220Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:53b6e3905918d538ef76c413c9d5b5295e01bdeb7736d0dcfc47af40847f13d6","observation_id":"ab44a47c-17d8-4fce-8e05-3e7632e2a063","resolution":{"observed_at":"2026-08-16T05:53:23.278220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-13T18:28:46.913210Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-16T05:53:23.281964Z","title":"Benchmark evaluations, applications, and challenges of large vision language models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.281964Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:ea0162c3aa202211ac7ce005f7d552292b5dbeb7c664a079e3665c70df3a9166","observation_id":"baacb898-2f08-4b8e-ac46-a2cabc026a14","resolution":{"observed_at":"2026-08-16T05:53:23.281964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-18T08:41:13.372775Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-16T05:53:23.286456Z","title":"A survey of vision-language pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.286456Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:5199e8c6d5ae75cc489d8751d1c2d5b708dcbb16382a8a9850690f7054f6cd9e","observation_id":"e123e2f9-c737-4629-be61-731edebd03e0","resolution":{"observed_at":"2026-08-16T05:53:23.286456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-16T05:53:23.290607Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.290607Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:97bb1fa921b506410dd5e69519d11dc3249e04dfbddc17f2aaac621d0e9ea1c1","observation_id":"c852f6d2-61f0-4313-9e83-13b3a24245e0","resolution":{"observed_at":"2026-08-16T05:53:23.290607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.851633Z","title":"Vqa: Visual question answering","venue":null,"work_id":"9c23f70a-c636-4de9-aebc-64366d40030c","year":2015},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.294509Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:f8e46c2a4c343e3db68dbc0cfb7b67d359666dfb18aa924a46636c3172e8fe6c","observation_id":"51a3d3c5-7bed-4174-98dd-978f5cb96ff2","resolution":{"observed_at":"2026-08-16T05:53:23.855623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.298221Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.298221Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:90ba004f3d201488d304e4dfcfad51821252532ae51569401daa83b4c0939eb3","observation_id":"46e7a9cd-f51f-430d-ac1d-8d54fa3e8eb7","resolution":{"observed_at":"2026-08-16T05:53:23.298221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.301738Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.301738Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:57a49a19555eec5f3ba98a45eb379729b1a4de986f3f68d2271351b0970ad60f","observation_id":"103d7a38-3bd6-4b96-ba23-4a2a22f5886b","resolution":{"observed_at":"2026-08-16T05:53:23.301738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.827092Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":"deae9965-a959-43f0-8cb4-ca05db7173f7","year":2015},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.305013Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:ef501b5c813d806f74bbcaf913f94e7552412b89eaf7ddd2df1d3daee48d9b01","observation_id":"4aee89f1-4bfa-4a48-890f-db5498a783ab","resolution":{"observed_at":"2026-08-16T05:53:23.831153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:53:23.815830Z","title":"ℎ#\"ℎ$\"ℎ%","venue":null,"work_id":"b8ef9067-0383-44c8-ab92-fcbe80aeb592","year":null},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.309664Z"},"links":{"citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:9294c3cab09b6831ac8b5e7178653dd5b321875a1f3261c7094aa9401f16da13","observation_id":"38b7fd2e-bc50-48a5-89fb-25dcfb9270f2","resolution":{"observed_at":"2026-08-16T05:53:23.819377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 3 inbound Pith citation observations for arXiv:2504.19627."}