{"as_of":"2026-08-09T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3981e4c7fe01e8dd00eba7ae6d44119569f16015a9b69d2470669a70f30108bf","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:12:39.481162Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02909/citation-record","integrity":"/paper/2607.02909/integrity","json":"/paper/2607.02909/citation-record.json","paper":"/paper/2607.02909"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:10304af1c4a610b25a29263436c89ea2c59c032786850936daf0a6db79c47d4e","observation_id":"15eaa4b3-e855-4afb-a684-d7132d0f7111","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"L., Roohi, S., Granroth-Wilding, M., and Cucchiara, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:f126a2e2359e79657d40b9cff15bb61608dc0e0c8e71b590ace675cb7522f1bd","observation_id":"d946ba3c-9885-4c01-93a2-583e45e3dfed","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08253","last_updated":"2025-03-11T10:17:32Z","snapshot_observed_at":"2026-08-07T17:13:41.536737Z","submitted_at":"2025-03-11T10:17:32Z","title":"SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08253","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"SARA: Structural and adversarial representation alignment for training-efficient diffusion models.arXiv preprint arXiv:2503.08253,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2503.08253","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:de806dece9d3987ea21169704de5a8978b75d357608e38b8ed70e31d3013155f","observation_id":"58a4b665-cd47-43b0-a594-62e065d60301","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"On large multimodal models as open-world image classifiers.arXiv preprint arXiv:2503.21851,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:11031668440e4c3231940c5e6381247b3608a4469c6f037ff27cd54f4069741a","observation_id":"1304a377-bcec-4322-a0c5-09b9e2af6e08","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Hyperbolic geometric graph representation learning for hierarchy-imbalance node classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:eb4b984dfb45cef8aa64101185142c510d7ade2d4a716cc18f3d3ab84b9d9649","observation_id":"9d14c701-6a10-48e0-9795-8d2f2c061558","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14496","last_updated":"2024-06-20T16:59:39Z","snapshot_observed_at":"2026-08-06T15:49:16.711048Z","submitted_at":"2024-06-20T16:59:39Z","title":"African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14496","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"African or euro- pean swallow? benchmarking large vision-language mod- els for fine-grained object classification.arXiv preprint arXiv:2406.14496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2406.14496","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:d91c23fd5bcf95989ccd48465fb891dd9665dd71e6426d36b2679c2658293569","observation_id":"024b2bff-2db0-44de-a964-6b451cab8f28","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02995","last_updated":"2023-03-06T09:44:01Z","snapshot_observed_at":"2026-07-06T14:59:03.634181Z","submitted_at":"2023-03-06T09:44:01Z","title":"HiCLIP: Contrastive Language-Image Pretraining with Hierarchy-aware Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02995","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Hiclip: Contrastive language-image pretraining with hierarchy- aware attention.arXiv preprint arXiv:2303.02995,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2303.02995","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:1d0f7df9414742736fc46eaea6416763c0ea370d6cbfb435479301dc942816e7","observation_id":"894719a4-b95c-40be-8a56-b1c218b4ae65","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15140","last_updated":"2025-03-30T13:12:34Z","snapshot_observed_at":"2026-07-06T20:26:03.338338Z","submitted_at":"2025-01-25T08:52:43Z","title":"Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15140","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Analyzing and boosting the power of fine-grained visual recognition for multi-modal large language models.arXiv preprint arXiv:2501.15140, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2501.15140","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:fea40d7aa9244f0798decef0a42f0bc1a91374fc3a71220d63e7c8ee839d451e","observation_id":"f20cbdea-c7fb-47ff-ab85-b55ed29a3387","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:2e2a574dcb6206cd9486b8b73370466ca887078868d8b8b58ad876f4238885b3","observation_id":"83039bf7-4a10-4dcf-bcd1-69d337cb5469","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18533","last_updated":"2025-06-23T11:43:39Z","snapshot_observed_at":"2026-08-06T23:13:32.064771Z","submitted_at":"2025-06-23T11:43:39Z","title":"Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18533","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Geometry-aware distance measure for diverse hierarchical structures in hyperbolic spaces.arXiv preprint arXiv:2506.18533, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2506.18533","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:175ead5415a5ccbd4cdd5d584248896ab89a1915cc029f6954c022b7e62f8187","observation_id":"895b62b0-f79c-437a-aa09-27c681ce57ce","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"F., Zhao, Z., Feng, X., and Sun, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:3c34d29bff751838a5063ad4dad3dfe82fdd6e1c1850b6cbdd39df6344b514d1","observation_id":"61dab304-2bac-4ad2-b912-37e59559a1d6","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06912","last_updated":"2025-03-01T13:43:36Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:12:50Z","title":"Compositional Entailment Learning for Hyperbolic Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06912","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2410.06912","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:fd12d9efa2e4a37f64c121906475ace72279dccf3eca2865574dcbcf4ea3887c","observation_id":"b650d89f-bc9e-4eeb-8b00-0a3e374ca1d4","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Y ., Beery, S., and Huang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:b55152f5ac8dc79666ee018a990c1344685556302c60a9c0565a45ce706e11fe","observation_id":"1e94ef97-9f43-44d6-9a91-830ae135c94c","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08210","last_updated":"2021-03-17T14:36:34Z","snapshot_observed_at":"2026-08-09T02:23:26.372307Z","submitted_at":"2020-06-15T08:23:20Z","title":"Hyperbolic Neural Networks++","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08210","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Hyperbolic neural networks++.arXiv preprint arXiv:2006.08210,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2006.08210","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:123524c943c9337b136aeb2c5f2a96b4fb244a663b798360ca5efe0048d929e7","observation_id":"83c480a7-b7cf-40a0-ae42-8517ef1be0d0","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05457","last_updated":"2025-04-07T19:46:59Z","snapshot_observed_at":"2026-08-07T16:07:48.289737Z","submitted_at":"2025-04-07T19:46:59Z","title":"Taxonomy-Aware Evaluation of Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05457","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Taxonomy-aware evaluation of vision-language models.arXiv preprint arXiv:2504.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2504.05457","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:8b12407eb96bd19230a4831cb41f30dbea5f468193a3eac020d2dce959dfb3db","observation_id":"d99979d9-fa58-4528-96c9-908bff5de1ae","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"The llm bottleneck: Why open-source vision llms struggle with hierarchical visual recognition.arXiv preprint arXiv:2505.24840,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:f0e13b88bfa43b993b6500f10a981564d866b433fdd9f78518028fbcdccc9b76","observation_id":"9615fbb6-0915-4ee4-bc10-286edeb32129","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:b7d2e0f8e0cbba7f3cf1a2103f6ca4dc5d7f9f10f94133c17752796b4640c929","observation_id":"03534dc7-425c-4892-aa88-7e1e9988565f","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:51eec859b404a17c3ef2a26eac8ed3b5e6b1622a6e5f4180d6d7b3e0a79ea612","observation_id":"d3df126a-c750-491f-9a4e-befdb0584e3c","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03825","last_updated":"2022-03-23T04:27:29Z","snapshot_observed_at":"2026-07-06T12:45:21.570121Z","submitted_at":"2022-03-08T03:21:45Z","title":"Incorporating Hierarchy into Text Encoder: a Contrastive Learning Approach for Hierarchical Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03825","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2203.03825","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:67f470071147f9bcf324086f92052c4d359646d7177b8f3f18ce37442d5240fb","observation_id":"c39b660a-3ef8-4cd9-a912-d83f3bc6112a","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27391","last_updated":"2026-05-28T13:27:52Z","snapshot_observed_at":"2026-08-04T07:03:11.161864Z","submitted_at":"2025-10-31T11:32:15Z","title":"Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27391","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Modality alignment across trees on heterogeneous hyperbolic manifolds.arXiv preprint arXiv:2510.27391,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2510.27391","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:bb9da38563b991345325b2fbd924f6506e807d2f63ac9608c089c9fa98e77fec","observation_id":"91405353-5735-4418-8222-bff744beb35c","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"On the general- ization of sft: A reinforcement learning perspective with reward rectification.arXiv preprint arXiv:2508.05629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:89146162f1134c6e1e987dcdec5cf130966865b006a26f0cd5640bb8bb37ee44","observation_id":"dd1a1a41-38c9-412b-a69b-c572693e617e","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14064","last_updated":"2024-12-02T00:42:44Z","snapshot_observed_at":"2026-08-06T19:11:17.226491Z","submitted_at":"2023-11-23T15:42:42Z","title":"HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14064","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Hgclip: exploring vision-language models with graph representations for hierarchical understanding.arXiv preprint arXiv:2311.14064,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2311.14064","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:51dc60dad799d15369e1d237aa92dba11ec9c4dd099096e292f07b538653a031","observation_id":"51e350e9-49b2-4800-99a5-e8787c93aa51","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Visual representation alignment for multimodal large language models.arXiv preprint arXiv:2509.07979,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:673ba7024b9ba819942934a08f5b1ac44e32eda57d697919364f5d30b7fc86c8","observation_id":"bb15ac7a-23f0-4252-8359-d5c4b61b0678","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14988","last_updated":"2026-04-30T15:12:07Z","snapshot_observed_at":"2026-08-03T01:40:56.706749Z","submitted_at":"2025-04-21T09:30:41Z","title":"Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14988","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Bench- marking large vision-language models on fine-grained image tasks: A comprehensive evaluation.arXiv preprint arXiv:2504.14988, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2504.14988","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:dbc3891d2b236859826a64b505026b9d1ad7c7435b4d6aff1d39f90dd68f5f02","observation_id":"9289ae94-245c-4a6f-973e-0d73c92dee69","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03052","last_updated":"2025-04-20T01:00:27Z","snapshot_observed_at":"2026-08-01T13:41:08.572886Z","submitted_at":"2024-10-04T00:20:34Z","title":"Learning Structured Representations by Embedding Class Hierarchy with Fast Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03052","snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Learning struc- tured representations by embedding class hierarchy with fast optimal transport.arXiv preprint arXiv:2410.03052,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"cited_paper":"/paper/2410.03052","citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:b64ea39c37af8bdd6fcaa9cf86700054dbd1ad965f5672323738a29189abd72f","observation_id":"14cffd00-e41d-418f-81fc-70dc0120ff74","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":"Theoretical Analysis of Dispersive Loss In this section, we provide a rigorous theoretical analysis of different variants of the dispersive loss under hyperbolic geometry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:f20d22e40ddda677c1ba8833e022850ff516d5415ab85d77d54461bea0d2a533","observation_id":"e33f9d4c-9ec1-4ed7-9c9d-91d69dc84f47","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:39.481162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:39.481162Z"},"links":{"citing_paper":"/paper/2607.02909"},"observation_digest":"sha256:21645dd01d4d98086957e316dd3dde4fedcbeaf993015f98d017408cdc0d9d93","observation_id":"f5d9d17e-9695-4aeb-9b94-b0eedb3071b1","resolution":{"observed_at":"2026-07-12T06:12:39.481162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02909","last_updated":"2026-07-03T03:16:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:23:04.586730Z","submitted_at":"2026-07-03T03:16:41Z","title":"Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.02909."}