{"as_of":"2026-08-09T18:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dded04a71539040a88f17aea04489c6722229de9cedcff7bb2d8d5330b3c26c4","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:56:27.154410Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:45:23.828033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:25:11.499059Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20025","snapshot_observed_at":"2026-08-04T19:45:23.828033Z","title":"A man wearing a orange jersey with yellow stripes, a pair of black shorts and a pair of green shoes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09118","last_updated":"2025-09-11T03:06:22Z","snapshot_observed_at":"2026-08-09T14:31:35.766097Z","submitted_at":"2025-09-11T03:06:22Z","title":"Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:23.828033Z"},"links":{"cited_paper":"/paper/2507.20025","citing_paper":"/paper/2509.09118"},"observation_digest":"sha256:6bc4d3da530a122f722d14c2f22daf00997dcd13285322bbd621b76e4bb886b7","observation_id":"fda919ed-db74-41ad-bab1-53962652ed2a","resolution":{"observed_at":"2026-08-04T19:45:23.828033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.20025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20025","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Region-based cluster discrimination for visual representation learning","venue":null,"work_id":"0e66094c-2a38-4f67-ad44-bae62aebaa6b","year":2025},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2507.20025","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:f98ed36b4554de321c15e5cddcc475deb9f0199d00fc37b734308bd40e248ceb","observation_id":"94f0dd6d-908b-4968-9f9a-ccadb3d367a6","resolution":{"observed_at":"2026-05-17T20:25:11.501302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20025/citation-record","integrity":"/paper/2507.20025/integrity","json":"/paper/2507.20025/citation-record.json","paper":"/paper/2507.20025"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.620832Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.620832Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5a0cc8903d19350601b0dababcaed52f71136339eff342ea89d6bac9c18fdaa1","observation_id":"9d27e9e5-90cd-47e1-b314-216d3e546ae3","resolution":{"observed_at":"2026-08-06T13:56:26.620832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.626364Z","title":"Killing Two Birds with One Stone: Efficient and Robust Training of Face Recogni- tion CNNs by Partial FC","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.626364Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:80b376f52fc9d47d9edd4456e90073f86dd68e102678488e9bebcd1eedfc664f","observation_id":"8868673a-26eb-4cf2-b49b-0c61982daff4","resolution":{"observed_at":"2026-08-06T13:56:26.626364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.631180Z","title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.631180Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:38848743358cdc546dfead722488c43a3545f7644166a15e0a1f067f1eb0fa0a","observation_id":"23c24aa5-7378-4b86-90bb-b65e2b4d4185","resolution":{"observed_at":"2026-08-06T13:56:26.631180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.637509Z","title":"Multi-label Cluster Discrimination for Vi- sual Representation Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.637509Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:fea4fee9695d631a918e3dcb5ff6e9b24afbb5a008c0592b915ab3fb6982870b","observation_id":"3df184d6-0d62-46b5-9918-15d2ce409e0c","resolution":{"observed_at":"2026-08-06T13:56:26.637509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.642982Z","title":"Self-Labelling via Simultaneous Clustering and Representation Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.642982Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:ec3156d39f226e067dbfec9e4300e6e2ba19831fb31a6c31689fb018a858999f","observation_id":"c4bf6569-b086-45ac-999b-3e4c1faa0cbe","resolution":{"observed_at":"2026-08-06T13:56:26.642982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:29.060558Z","title":"Qwen technical report","venue":null,"work_id":"109a99ae-08b4-4399-8542-13f8885b3abd","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.651574Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:4551788f4402ffdc4832fa8b62f9359a3101b0e9e9ac113b5de2979f228bc549","observation_id":"a2dfd4bc-a44f-409b-9d59-2b3fc8f9a51c","resolution":{"observed_at":"2026-08-06T13:56:29.066111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T13:56:26.656817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.656817Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:f75dc91d1ee76db9e0c58afbeea7e7359dcccb5b93e829e644512f5cfb32e9d1","observation_id":"e2820eea-58b2-499b-a168-dadc71350e12","resolution":{"observed_at":"2026-08-06T13:56:26.656817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:29.040105Z","title":"COYO-700M: Image-Text Pair Dataset, 2022","venue":null,"work_id":"1f55c719-1854-4931-a2ca-49813c7447ce","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.662383Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:ae6e14adf8dbc1ac51d8f73c0bd6995557610f7e211787d03b5b8f48f5f179a1","observation_id":"6b2cdd11-877a-4c4d-8371-ce279011b5aa","resolution":{"observed_at":"2026-08-06T13:56:29.046242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:29.016522Z","title":"Cascade R-CNN: Delv- ing Into High Quality Object Detection","venue":null,"work_id":"d2e22cff-c84c-4ca4-8634-8cf7b5e4de28","year":2018},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.666694Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:c2922718a5727e3c161486b13cf7827db7c59b48d6fc8a84189985891ce9b8b2","observation_id":"f108fb0a-08be-4dfb-a16d-d819fab94525","resolution":{"observed_at":"2026-08-06T13:56:29.026478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.992854Z","title":"Deep Clustering for Unsupervised Learn- ing of Visual Features","venue":null,"work_id":"aedcaa90-bcb1-45af-85f7-5a3af558a669","year":2018},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.671354Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:a590abd54473c251891d1cc3570979c033e4960c77c104e27412bac279e62e0a","observation_id":"0fffa4a4-41a0-4c5e-a078-b6f749525d48","resolution":{"observed_at":"2026-08-06T13:56:28.998554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.972331Z","title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments","venue":null,"work_id":"1a61146c-e7fc-4b46-a79d-ba1c625b93b6","year":2020},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.676512Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:466133670c7f0f0df233c96e9686fe5849287f17d9a78358156e8c70bcac2894","observation_id":"578b62d4-a23a-46e4-a847-3b1d28b6a4cd","resolution":{"observed_at":"2026-08-06T13:56:28.978389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.949457Z","title":"ViTamin: Designing Scalable Vision Models in the Vision-language Era","venue":null,"work_id":"4828360d-faf1-485a-9f01-c9910233ecd7","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.681641Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:9fa3dc5718f3d2b702fb8c373f700df1072d279e0bdbc65f6fb9eccc9b3b779d","observation_id":"8e9e1edb-639c-4061-bfeb-20baea1782d5","resolution":{"observed_at":"2026-08-06T13:56:28.955934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.921461Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models? In NeurIPS,","venue":null,"work_id":"1c78e038-7605-4c35-8f9d-8b78378d1b60","year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.686659Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:73c4479bb8d0c8bac139248d80dce11fb732488825d8d33f640838e7d7a6c1d3","observation_id":"1e2a0df4-f371-4e92-b130-f2c8ec6c88ff","resolution":{"observed_at":"2026-08-06T13:56:28.929358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T13:56:26.692234Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.692234Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:41dc9b723d63c9748edd525e31e8039ba824617dbce74f8054e438632c890d3f","observation_id":"c3b4a854-0718-4eeb-a6ed-0b934ad31461","resolution":{"observed_at":"2026-08-06T13:56:26.692234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.899325Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"55cca640-5c5a-4478-8447-1190f95bf2d9","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.697377Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:dcba3c39141196f933ed8eb2699b72212d62b90866b99dbe83e1e2e06b8455ea","observation_id":"bfa25025-d2fe-41ed-a6e3-979cb33f21a4","resolution":{"observed_at":"2026-08-06T13:56:28.907699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.879687Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"b3465834-08d3-4f2a-a3e8-3afbb18d5951","year":2019},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.702288Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:8510dad406d6620dd77a762c356faf0f70e5f5a29ccd20796b75cd978ee7f5d0","observation_id":"7dfce565-8f2b-4ad1-93c3-541aa343f1a4","resolution":{"observed_at":"2026-08-06T13:56:28.886230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-06T13:56:26.706863Z","title":"The Faiss library","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.706863Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:a639e3c2a9c8926f2bcab47ad0ce19af702476ac87df52e6e8f0b2c1d8493928","observation_id":"d8324a6a-4407-4564-8ed6-ddb1548f8dd2","resolution":{"observed_at":"2026-08-06T13:56:26.706863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-06T13:56:26.712695Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.712695Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:36c2c6f26d629a8cc5d752119d25484849a37bbf4bc18bfd418994d694a72c9f","observation_id":"b146aa89-7293-4f63-b417-42e088c20978","resolution":{"observed_at":"2026-08-06T13:56:26.712695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.860224Z","title":"Susskind, and Armand Joulin","venue":null,"work_id":"31285ebc-260c-4644-977c-fb421ee99def","year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.717823Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:84962cdafc7ee81a5260f1ade81610d58f963850737eb5db779d0936364458a3","observation_id":"29539a18-5b0b-4e5d-8870-d4fba7cc9c45","resolution":{"observed_at":"2026-08-06T13:56:28.867030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.838787Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":"6397b827-f35e-4a12-980f-5871c7a0bae4","year":2019},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.724305Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:359aa326391419fba31148e91ead247b697df338543bd600510d23508362e0e6","observation_id":"c9476024-a4a2-4b42-8843-323ab6014549","resolution":{"observed_at":"2026-08-06T13:56:28.846191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.812400Z","title":"Data Filtering Networks","venue":null,"work_id":"c0bc8830-19fc-4bad-a308-ec5e8e58c4c9","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.730472Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:b24c079734235ae386399f5adc4f476e57958fe8db6bbfedcd8c8653164f732e","observation_id":"dd485a37-c933-4ca5-b1fa-67ff4b57e0d5","resolution":{"observed_at":"2026-08-06T13:56:28.823850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.793046Z","title":"Multimodal autoregres- sive pre-training of large vision encoders","venue":null,"work_id":"2c0257c1-6d32-4423-9a81-b64b478d6d01","year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.735675Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:3f151abd8734caf0f0df023bca6f4afd7679cd687cd2662b24f30153f7072f8b","observation_id":"7da053c8-a2d1-410d-b8fa-7375d0bfc7ff","resolution":{"observed_at":"2026-08-06T13:56:28.798405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.769657Z","title":"Rwkv-clip: A robust vision-language representation learner","venue":null,"work_id":"bbcbe849-168f-4a9a-ad64-899c7ed5c7ba","year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.740772Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:505a3fa7ffde7575040eaa1d271ffc7d5767cd94ad58ae73190079073206f24b","observation_id":"9eca4821-f4c1-4417-92bb-4244ff285e9c","resolution":{"observed_at":"2026-08-06T13:56:28.779670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.746624Z","title":"Mask R-CNN","venue":null,"work_id":"a2021270-c10d-4125-b6e9-6f31b05b5bcd","year":2017},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.746235Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:32fe8c5a4c7795728f60750965951539f42855d33accfc0c508a59c52d426610","observation_id":"a33c675a-2da5-4bb6-9a0c-2f8318c0da50","resolution":{"observed_at":"2026-08-06T13:56:28.753046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.715323Z","title":"GOT-10k: A Large High-Diversity Benchmark for Generic Object Track- ing in the Wild","venue":null,"work_id":"1d9162d1-ddde-4ee0-8986-32cb1a7d4335","year":2019},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.750708Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:0c58261072a72e281411f3dcd5c8f08ca3eafb2c67cc46fd8ae4058f5e4a63b3","observation_id":"53731b7c-aa3f-4b22-ab30-b6e47e40e7f4","resolution":{"observed_at":"2026-08-06T13:56:28.730690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T13:56:26.755498Z","title":"Qwen2.5-Coder Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.755498Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:3078c34fc42103335eec80e922bd66bfe31f97c568ee7e81ff8482cd326cbebc","observation_id":"831c0921-b0f0-4ddf-8bbb-63248ddfcd90","resolution":{"observed_at":"2026-08-06T13:56:26.755498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.690955Z","title":"Open- CLIP","venue":null,"work_id":"33d762a4-1c8b-455c-bbad-bed1e020a2c0","year":2021},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.760557Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:323d3dc0565e67b8821d7b12ce991ef4bb31f083d9c55235ddf0ee2f4f293a31","observation_id":"1f99e61b-8935-4477-8fae-7a8ce65b8268","resolution":{"observed_at":"2026-08-06T13:56:28.700746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.665671Z","title":"ReferItGame: Referring to Objects in Pho- tographs of Natural Scenes","venue":null,"work_id":"00b5ae4d-9008-4f40-80f4-828a9c7444f3","year":2014},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.765785Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:ecd541498fe0e7252bb3e6cb97f44b23807aeeb95400e1bc067e31bb04bff162","observation_id":"25b17057-5684-4168-a833-b837c1a7f00b","resolution":{"observed_at":"2026-08-06T13:56:28.674280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.644624Z","title":"A Diagram Is Worth A Dozen Images","venue":null,"work_id":"a533100e-a91d-4e95-a473-4f9ba7dd291a","year":2016},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.771976Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:8183a461e5ea65d99a717db791226be1acedc68eb4a986592ebc7182836db686","observation_id":"dcd687b2-8d25-4930-b35b-8edb59ccba1f","resolution":{"observed_at":"2026-08-06T13:56:28.650994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.626886Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"2102e3fe-032a-48d8-b05e-9675f2f2fd53","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.777420Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:ccb228236a95cabdc03c76220278309a3ed426b0b1d61adfb8f76fad72da142b","observation_id":"a7fb8d0d-3d8a-4779-ac90-ffc4779320cb","resolution":{"observed_at":"2026-08-06T13:56:28.632191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.597446Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":"4bd7e9c9-626b-47af-8f24-96c06fb697fe","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.782673Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5c084e22e613c1c61db84698369162967366de8be0686e5448dedf94b92b7509","observation_id":"3e702191-796e-49c1-a3cd-030fc1a6177b","resolution":{"observed_at":"2026-08-06T13:56:28.607227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T13:56:26.787539Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.787539Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:be404a7c432e1b3bef57c347c9bfc8baaa316c5265a0fd3a141bd2edf09106f2","observation_id":"7bb3a0c4-e890-42c1-a10f-d8b71f41b409","resolution":{"observed_at":"2026-08-06T13:56:26.787539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.579415Z","title":"LLaV A-NeXT- Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":null,"work_id":"8272565d-0b7c-4783-bcc9-b6d4024bda7f","year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.793074Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:e8d1859acb945ab3eb7dc2c17d7fc08980f0993cdf38d7d0898232b1a6818785","observation_id":"9f0f6b97-000a-48ed-bc77-a3243f92d05a","resolution":{"observed_at":"2026-08-06T13:56:28.585248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.560572Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Uni- fied Vision-Language Understanding and Generation","venue":null,"work_id":"05f23f49-31fe-4faa-bae2-b01af991bda7","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.797553Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:389a921fbda0b380350adb793f6a0bc7b9b8129358696ad2967d52ee7f380bd0","observation_id":"b3d192ce-99cc-4172-ab06-8e832e4deb7e","resolution":{"observed_at":"2026-08-06T13:56:28.566597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.802594Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.802594Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:09724a0af395cb11c41ced86e4f11149e9440ead652d4e55191bafc3e8ab433e","observation_id":"f6a983ab-5036-4cde-8167-d20eadee74bb","resolution":{"observed_at":"2026-08-06T13:56:26.802594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.530607Z","title":"Grounded Language-Image Pre-training","venue":null,"work_id":"3604691a-0261-47e4-810d-fe84d9ba9591","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.809119Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:c72733d77500e9791735229d19ded9e335bf83b14a07cab845c51d266cc438db","observation_id":"1b9bec1e-7071-4909-86ed-b072b299f8f4","resolution":{"observed_at":"2026-08-06T13:56:28.535545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.509352Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":null,"work_id":"8e382700-cc04-4a5b-b22c-f49067893c04","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.815122Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:8591c143537774fd5e9d4fe3507a6a3582b658d8e09ac272268c1dda315b9f05","observation_id":"f7bf54cd-4a72-425a-afff-4da048306f93","resolution":{"observed_at":"2026-08-06T13:56:28.518580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.488144Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"45c2e797-08c0-453a-ad73-7025fd38a2a1","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.820691Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:bb72c68806b062b263e69cc0e8ab1c251f107b61cf1d2d0a5e8d22b2e158c0cf","observation_id":"7c4e8872-88e8-4dda-8e84-eff047bc3706","resolution":{"observed_at":"2026-08-06T13:56:28.494563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.467399Z","title":"LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge, 2024","venue":null,"work_id":"f5cafcec-929d-4c7c-a0f5-f3d12f8813f9","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.827107Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:aa089a2b4aef9e6f9f6b5d71d9c8b1819073067e49e7da5d7ca6461107d402eb","observation_id":"bdf6e1e0-5c17-4ddc-8560-e01fe56d7b3a","resolution":{"observed_at":"2026-08-06T13:56:28.474788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T13:56:26.832006Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.832006Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:30144a02c2d1a8a834763cbf2df62f7be3e4a437fd25a3c7431d99a96dd91fc1","observation_id":"48d63edc-1a04-4082-8c6c-3645c3df4881","resolution":{"observed_at":"2026-08-06T13:56:26.832006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.445832Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":null,"work_id":"5afcb009-0b25-4f79-8b25-31f6deee702a","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.837827Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:0e17ca06eac9fe6fc4dc5999f534363944a8ca6760e151f0ad103cf74038c821","observation_id":"753a9abb-feb5-4ca5-a431-1860ae9fa98b","resolution":{"observed_at":"2026-08-06T13:56:28.452881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.420348Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"694fccb3-acbf-48cb-8c4b-e0426341e7e7","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.845274Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:1f1958ade1a14ae07493c15fcfe1a9276a6511b4e29475346630d5197a4ede7b","observation_id":"ce541bc0-2f36-4504-8aaf-a20c5f68913c","resolution":{"observed_at":"2026-08-06T13:56:28.427578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.399047Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"6db3711e-4296-4c69-8f1b-135eb70a2899","year":2018},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.850988Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5d0e07709051951548abcbb01a66fdeb93a0d20abfa9b373ff89a743800375f2","observation_id":"27363820-ae25-4de8-be49-c9d041d58616","resolution":{"observed_at":"2026-08-06T13:56:28.405520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.378660Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":"33ef7ea1-1387-4c6e-833e-8fdfcc9cbafe","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.863231Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:4aa27b691c64cec270f73f3907cb63b5d70c9f790d0eb0e734448efe0ba73276","observation_id":"8325b1ff-7101-45a9-b261-cec3714f2db6","resolution":{"observed_at":"2026-08-06T13:56:28.385809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.339694Z","title":"DocVQA: A Dataset for VQA on Document Images","venue":null,"work_id":"a3b7d8a2-836a-4189-9255-3f8dff8575de","year":2021},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.867868Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:2288e553800e746aa655046b4a720aed8d35043591aeb9398b21bb8f77833b7a","observation_id":"8a7b096b-fd37-40ff-bb55-8683b2c7e2cb","resolution":{"observed_at":"2026-08-06T13:56:28.361845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.320505Z","title":"Infographicvqa","venue":null,"work_id":"8fa36738-8633-460b-9836-278ea5895988","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.872346Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:d8049e6ede173157294ecb7230f1f49beaa8e68948036267d5092c1a3c0c7be0","observation_id":"d8b543ac-7c86-416a-b3ff-6403778287c1","resolution":{"observed_at":"2026-08-06T13:56:28.326016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.299548Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"4d2137f4-41ba-41ce-8992-26e8229bd427","year":2018},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.876897Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:690108a0235ab3ef636dd857e36d076d03b0ff6e8a91b0b962522f113b390301","observation_id":"7ad7ac98-048f-4fff-80fd-2ce7c300efac","resolution":{"observed_at":"2026-08-06T13:56:28.305168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.277503Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":null,"work_id":"6a88501f-b18a-4604-a53a-dbfebb739f32","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.886959Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:c87812a80fd382d43e7d94c93a91e48f32a0c366dc2e666cf5131c2ab0fca244","observation_id":"3ccbe1b7-1617-4de5-81a7-5c8db38b6b02","resolution":{"observed_at":"2026-08-06T13:56:28.282928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.259212Z","title":"Filtering, Dis- tillation, and Hard Negatives for Vision-Language Pre- Training","venue":null,"work_id":"0a2d0aef-b611-4179-8111-93fb5e71139f","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.892625Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:18d439e4d691ed7eba5a7e761fb26da57b53c3e9f08c917b71296b99e18d4b8c","observation_id":"8409c45a-edc2-488d-a0c7-584227948456","resolution":{"observed_at":"2026-08-06T13:56:28.264964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:26.898477Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.898477Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:f6e0e8f6242e23236e8a45c15113d865f489e465416201e71f2ab510671c4390","observation_id":"3a50cf7c-26f0-4d4e-97cb-92cb6e9c42d0","resolution":{"observed_at":"2026-08-06T13:56:26.898477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.224111Z","title":"Pre- Det: Large-Scale Weakly Supervised Pre-Training for De- tection","venue":null,"work_id":"d64d0929-86d4-41c9-b98c-4caad5495900","year":2021},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.903501Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:18067e70548a43ae3cafa2dd16963a716a9b10c1b38e82f861aa3f00208709f1","observation_id":"b5e727e8-f463-45c6-9112-b84d5741ffab","resolution":{"observed_at":"2026-08-06T13:56:28.230114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.205527Z","title":"GLaMM: Pixel Grounding Large Multimodal Model","venue":null,"work_id":"9c2540d3-fa5d-4a40-a9f2-435ecf3c34f9","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.908430Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:b4f9d514e5fcad8c58168814c7351ea9d157339d3ec7ae5d37974117ea5b9a83","observation_id":"c10f915b-06bd-417d-b452-4dfa7ea248b9","resolution":{"observed_at":"2026-08-06T13:56:28.212070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.185738Z","title":"You Only Look Once: Unified, Real-Time Object Detection","venue":null,"work_id":"e5cd88f4-3860-46c0-b4d9-22c8995d4b17","year":2016},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.917252Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:86d3912a3bb4011f5d0148bc2dce8891ed7a23725362f9ca829b3836d407ee36","observation_id":"e52daf83-4f0e-4f25-baa8-f8689b1cebd1","resolution":{"observed_at":"2026-08-06T13:56:28.192059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.167616Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","venue":null,"work_id":"66998748-5d97-4b18-aab7-73d1d9ceeeaa","year":2015},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.923646Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:d0abd25b39b50b76f3619f7b162f9c1696b32add6403d4425bec279d6d54d368","observation_id":"be276d48-b716-4cf1-93ad-d34f601e39ad","resolution":{"observed_at":"2026-08-06T13:56:28.173309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.149588Z","title":"PixelLM: Pixel Reasoning with Large Multimodal Model","venue":null,"work_id":"21b1d849-10f4-4c0e-bd5c-5be6d6dabf99","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.928907Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:72766d9844204202a8d65580822bbde004b762d066137aa1c963003a3e93c52a","observation_id":"530b4c3e-d5af-4c39-b87b-1646dfe36edc","resolution":{"observed_at":"2026-08-06T13:56:28.155359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T13:56:26.933437Z","title":"LAION- 400M: Open Dataset of CLIP-Filtered 400 Million Image- Text Pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.933437Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:022975b02b6183adeff5801f177800620349c4e12343a4c20d33f63f7ca26d33","observation_id":"2b5aff1b-a1e1-4b92-894c-dcd9865ccf87","resolution":{"observed_at":"2026-08-06T13:56:26.933437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-06T13:56:26.939298Z","title":"LAION-5B: An Open Large-Scale Dataset for Training Next Generation Image-Text Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.939298Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:dab85171949961d1669f0130d3343aec0a55725d86ed00651c47ed7696378690","observation_id":"b0ed33ef-de76-4f7c-befc-f9cf0b90222e","resolution":{"observed_at":"2026-08-06T13:56:26.939298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10783","last_updated":"2026-08-05T15:52:23Z","snapshot_observed_at":"2026-08-08T23:12:33.810391Z","submitted_at":"2024-10-14T17:51:23Z","title":"LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content","version":4},"cited_work":{"arxiv_id":"2410.10783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10783","snapshot_observed_at":"2026-08-06T13:56:27.511991Z","title":"LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content","venue":"cs.CV","work_id":"14abb0e6-0210-4cc0-829b-988a53639e21","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.945884Z"},"links":{"cited_paper":"/paper/2410.10783","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:36b9aaa5522c11b63c68cf5ef87f3b7e8f1e2e8cbbfa98365bdd5f477b966a9f","observation_id":"b60b6483-f0a3-4a0d-a0c9-a35b9243415f","resolution":{"observed_at":"2026-08-06T13:56:27.520942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.128817Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":"6ebf71eb-1b48-4796-a554-071be8491992","year":2019},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.951466Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:8a984c1a6558d89788f7b95c5df9ab2cbc1b76c03a313080d07f6a3e6344aadb","observation_id":"7a4a02a5-98a9-4564-9c87-bf97628ac1d1","resolution":{"observed_at":"2026-08-06T13:56:28.134453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T13:56:26.956775Z","title":"EV A-CLIP: Improved Training Techniques for CLIP at Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.956775Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:073da74c8bf04d3f776186ab3c6b9ed74ed45f9d8ef72e9245f96def153fd99d","observation_id":"5ba26a7c-3263-4440-bbb7-fba95592b1b8","resolution":{"observed_at":"2026-08-06T13:56:26.956775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T13:56:26.970571Z","title":"InternLM2 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.970571Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:53bcccba43642a90b51507a6f644dd760ef05c6c7d709628f0661f2051894937","observation_id":"e8f3085e-e9a6-4d88-bfa3-2b10bd6d99c8","resolution":{"observed_at":"2026-08-06T13:56:26.970571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T13:56:26.976368Z","title":"LLaMA2: Open Foundation and Fine-Tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.976368Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5b5cd707f91008aef42fc348964a8b613365c52740fa861fa8fff38d46f89f11","observation_id":"dc6c820e-b7ed-4718-ad31-292029e152f4","resolution":{"observed_at":"2026-08-06T13:56:26.976368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T13:56:26.980964Z","title":"Qwen2 Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.980964Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5fb85839bb8be9bd093f4303fc1df48c2795df1826d8cabcb0cc0b2c54804c0a","observation_id":"d35d2446-da5c-4306-98b9-b9a8b73a0c16","resolution":{"observed_at":"2026-08-06T13:56:26.980964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T13:56:26.985779Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.985779Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:eb2f9099195f66001ef39c9dff5247db61fb859cef009a6ea7831eeca7498162","observation_id":"cfebeb82-92bf-4a0c-8c1b-d47e28915a94","resolution":{"observed_at":"2026-08-06T13:56:26.985779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.103805Z","title":"Cambrian-1: A Fully Open, Vision-Centric Ex- ploration of Multimodal LLMs","venue":null,"work_id":"ba968f7e-05e3-4791-b1d4-0da94ddae268","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:26.991478Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:b6a77b59b4d8a5a52c668a7d3020669273f001241a1971c34415f48460ea12d2","observation_id":"bf795244-f07b-47d3-a853-564efd7d6380","resolution":{"observed_at":"2026-08-06T13:56:28.111533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.085792Z","title":"SigLIP 2: Multilingual Vision- Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":null,"work_id":"f037c556-66f4-4a56-93af-84e808364b09","year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.001638Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:44866e3cab9f389e99d5ea338170d2c3313a77a6d50f8ecf7b5aae2e178ac9bf","observation_id":"3819060f-3dc4-4dfc-8c04-30c8e84759d0","resolution":{"observed_at":"2026-08-06T13:56:28.091143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.066154Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"08bcf284-31a2-4af3-ada3-a0b37ebc6f9f","year":2021},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.011523Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:202e0544a7b8bd55e2a669ffeb52e881816b7a96c5c27a56bfead80f9979addf","observation_id":"6d6b98e1-9908-4a3e-ba3a-6f43545751f2","resolution":{"observed_at":"2026-08-06T13:56:28.071897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-02T23:06:41.458983Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-06T13:56:27.018502Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.018502Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:b2e48e978aff9430d674917a1e4f04d47f7b5db124ffeef012da63a86d6d8032","observation_id":"657d9363-1684-4ead-a37b-93345585e330","resolution":{"observed_at":"2026-08-06T13:56:27.018502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.043359Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","venue":null,"work_id":"2ebc657e-c804-4865-8f01-e44bccba21e9","year":null},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.028344Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:92d71c12c1a43b80afa065d55aeb817312b7b3d90939332d5a89a593ce55891b","observation_id":"f4823ff2-3b92-4f85-b405-7b6a4de8ad42","resolution":{"observed_at":"2026-08-06T13:56:28.053255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11376","last_updated":"2023-12-19T05:08:45Z","snapshot_observed_at":"2026-07-06T17:04:41.812477Z","submitted_at":"2023-12-18T17:39:47Z","title":"CLIM: Contrastive Language-Image Mosaic for Region Representation","version":2},"cited_work":{"arxiv_id":"2312.11376","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11376","snapshot_observed_at":"2026-08-06T13:56:27.290346Z","title":"CLIM: Contrastive Language-Image Mosaic for Region Representation","venue":"cs.CV","work_id":"87be86c2-4ab8-405a-a657-5ff92c4f9afd","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.035845Z"},"links":{"cited_paper":"/paper/2312.11376","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:9d6b0486e19636bf9cbd432907ff7593a1149d3b7e6c27226c272e4b62065fe2","observation_id":"acda5a5a-9103-49b0-b146-687cec0e5dec","resolution":{"observed_at":"2026-08-06T13:56:27.300988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:28.019144Z","title":"Detectron2, 2019","venue":null,"work_id":"8e7a6d79-9e8c-4315-888c-c33b446e0ead","year":2019},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.043462Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5b5a4214566142de7744193fa341f0ba50fd09830ef391741b92d7822459149a","observation_id":"b1af74ed-cb42-455f-acb4-b746dbf93ecb","resolution":{"observed_at":"2026-08-06T13:56:28.024377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.995827Z","title":"Grok-1.5 Vision Preview, 2024","venue":null,"work_id":"3a3ea415-2c6d-4f78-92b2-6c90c54054ab","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.049705Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:171e05063670f244f8d895c83ea6c4657f03ef8e32a3b8ac21fe446e0c54fddc","observation_id":"201015b5-7acc-4979-b2f7-a1bcb35e7faa","resolution":{"observed_at":"2026-08-06T13:56:28.002476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.975862Z","title":"GSV A: Generalized Segmentation via Multimodal Large Language Models","venue":null,"work_id":"7a77842a-cea0-49cf-b29a-7628089c12e4","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.054660Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:caaef896e261d601c110c12a05ecebb8203badd488f7863b454f4f9c2aaa7e9e","observation_id":"f61d3b58-7c8c-4d2a-9fcc-9ece30bbb3cb","resolution":{"observed_at":"2026-08-06T13:56:27.981192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.951397Z","title":"Alip: Adaptive language-image pre-training with synthetic cap- tion","venue":null,"work_id":"225dcaaa-da8b-4518-b09e-00b58e1e74f0","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.060124Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:0c5c2d00e97494af375174ee6c8dc9279ed3727feae70e82704c6ef61092c50f","observation_id":"f83317b3-ff39-41fd-be81-9d7f03d44781","resolution":{"observed_at":"2026-08-06T13:56:27.957878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.930560Z","title":"Clip-cid: Efficient clip distillation via cluster-instance discrimination","venue":null,"work_id":"db398b41-acfa-4277-b30f-1e71d652a2cb","year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.066531Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:382dab8ebba485c83a398be66c8107da76ee89eab2d4db7c2f7c50492e87164b","observation_id":"9c9f9909-f995-4054-84fa-73af2da37528","resolution":{"observed_at":"2026-08-06T13:56:27.936687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.909068Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"5eb528b6-2d20-4854-8188-c3583c2cc192","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.073703Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:836795de6892f6084abc935e7d4aea97bd61608f318e9ffb529443205a77cb5a","observation_id":"9cc1d279-fad1-46d3-96c0-a32e559c724d","resolution":{"observed_at":"2026-08-06T13:56:27.915607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T13:56:27.081336Z","title":"A Survey on Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.081336Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:29711c8da8f67f694f865a34b4fac5756dd9698cd2d4eb646e6d346523f89ce7","observation_id":"339569e8-c32b-4f03-b790-3ac816ade7f1","resolution":{"observed_at":"2026-08-06T13:56:27.081336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.885674Z","title":"Berg, and Tamara L","venue":null,"work_id":"d5fce514-e98e-4ca6-8aa9-cc2691a7bf33","year":2016},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.088735Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:0d80d2ccb800f67e58702d5a9e2e05132ae8fb2243dfa58f284ad9f3af49a46c","observation_id":"66bad569-f09b-4ece-bc1c-a3277640fc09","resolution":{"observed_at":"2026-08-06T13:56:27.893374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-06T13:56:27.094504Z","title":"Sa2V A: Marrying SAM2 with LLaV A for Dense Grounded Understanding of Images and Videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.094504Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:114b9d4491b581294b0f3ae96fb89eda4d7c549fb80838e0d4e5283b7b9fb6e3","observation_id":"3bc442f7-61bb-497c-94ee-a3eacdfbc400","resolution":{"observed_at":"2026-08-06T13:56:27.094504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.864900Z","title":"Sigmoid Loss for Language Image Pre- Training","venue":null,"work_id":"c5a704a3-458b-4636-baa8-c36df6a8873c","year":2023},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.104031Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:04de0982c82648c8341d7e0af0cd168705f2e51fc99e2b237cfee2a2c03f3616","observation_id":"e2b9d908-9dc4-4cce-b933-a0198cb1c23d","resolution":{"observed_at":"2026-08-06T13:56:27.872321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.837577Z","title":"LLaV A-Grounding: Grounded Visual Chat with Large Multimodal Models","venue":null,"work_id":"7ca4fac9-5be2-407d-aa9b-c954fb1ef8ae","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.122836Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:6bcc9f8128053d6126fb5ed7e8f4c55eb5bed9be5dbe318b4be7f11136b0a271","observation_id":"e49f113f-e79b-416e-98d8-2837d5d0bfe2","resolution":{"observed_at":"2026-08-06T13:56:27.847480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.812666Z","title":"OMG-LLaV A: Bridging Image-level, Object-level, Pixel- level Reasoning and Understanding","venue":null,"work_id":"d58b5966-8563-4f07-a033-968dcb954b1f","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.130640Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:79e845c911474866b027a8eb27287ce4a8ee5b15cb3974a80506341de5af43e0","observation_id":"5673a67a-59b7-45a3-97f2-e0392912f68e","resolution":{"observed_at":"2026-08-06T13:56:27.818735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.788430Z","title":"RegionCLIP: Region-based Language-Image Pretraining","venue":null,"work_id":"420224b2-0481-4f82-b7d0-1e7ceecff8b4","year":2022},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.141777Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:7c59b2256e0f76be0e07ff58d3614236d2efeecd5ac5d31e5b808352a10f9776","observation_id":"2120dd39-0480-4a4d-a14f-4c6458c60d2f","resolution":{"observed_at":"2026-08-06T13:56:27.794744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.148197Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.148197Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:5fb4eadb7bdb1b9c6f99b8dac43abe451b638c7aa894b2226ac417355abf11e8","observation_id":"3253df0b-b858-4373-9757-f289e7f7a7e5","resolution":{"observed_at":"2026-08-06T13:56:27.148197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:27.753641Z","title":"UNIT: Unifying Image and Text Recognition in One Vision Encoder","venue":null,"work_id":"c8b80120-a0a6-4d90-9b62-f88cc5f69622","year":2024},"citing_paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:27.154410Z"},"links":{"citing_paper":"/paper/2507.20025"},"observation_digest":"sha256:ebc065abb0e495648779eb6a9931bc3cd8ea1a7fe4b97e4325ee19b81c360a02","observation_id":"2c432c4c-a465-4244-aaec-79ecb7ecaa98","resolution":{"observed_at":"2026-08-06T13:56:27.761473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20025","last_updated":"2025-07-26T17:47:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:30:44.768082Z","submitted_at":"2025-07-26T17:47:09Z","title":"Region-based Cluster Discrimination for Visual Representation Learning"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":58},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2507.20025."}