{"as_of":"2026-08-06T06:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd55c21cedb9e49e2fe091d6a06898f822623a439829326381bf5706df391c40","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:23:35.957580Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T01:54:30.649092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:04:26.424891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"cited_work":{"arxiv_id":"2602.14134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.14134","snapshot_observed_at":"2026-07-08T02:04:26.424891Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","venue":"cs.CV","work_id":"53e840bc-db1e-4322-896f-e3b906418d2c","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2602.14134","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:e1adc3e78d4ea19dd59f57ff7aef59a8b8f370747560a6f6099e8c8e81086fd4","observation_id":"e2fbf0c8-a908-4dbb-a474-6a0934b4ef71","resolution":{"observed_at":"2026-07-08T02:04:26.426147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.14134/citation-record","integrity":"/paper/2602.14134/integrity","json":"/paper/2602.14134/citation-record.json","paper":"/paper/2602.14134"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.463345Z","title":"RLE string","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.463345Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:05c931ca0a2099822351d8c15d384ad77dccc1b5fb3b74f0c687e79c1df06e51","observation_id":"96f62d90-8e2e-41b6-ad2d-0f6fed872828","resolution":{"observed_at":"2026-08-02T23:23:35.463345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.718786Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.718786Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:8c1087cab82db05bff47858a745ddc1c9988348fe2bb0e555f0e4f193a4805db","observation_id":"658d868e-8250-4af4-8bc0-9ce006f3c349","resolution":{"observed_at":"2026-08-02T23:23:35.718786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.302345Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.302345Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:11e14084f42fb452e4fdf04fe2b36bcc5fa0e902e76a55ae8f0e59e6529b226e","observation_id":"f46f50ed-9152-4b56-91ae-a312b9e0d20d","resolution":{"observed_at":"2026-08-02T23:23:34.302345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.473897Z","title":"Swinmtl: A shared architecture for simultaneous depth estimation and se- mantic segmentation from monocular camera images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.473897Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:760ba17a595381acf5ec0bafa739e47e50e54d5ec9a36803b3aa1159597fee3f","observation_id":"a15d26ea-df99-4243-8734-283e6f38b8eb","resolution":{"observed_at":"2026-08-02T23:23:34.473897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.644056Z","title":"Ufo: A unified approach to fine-grained visual perception via open-ended language interface.arXiv preprint arXiv:2503.01342, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.644056Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:61375d967486c09a64170e3f5f3a2a4639e02d17f3184f241bacdfdddf119684","observation_id":"75207e2f-7548-48ec-9a5b-1503e99d3947","resolution":{"observed_at":"2026-08-02T23:23:34.644056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-02T23:23:34.805229Z","title":"org/abs/2502.14786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.805229Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:7f98b5c5bf4675664d98141a7cdc0de3962869b8ff41c5f4282f3de7eb13b8aa","observation_id":"52b6dc11-bfab-4cda-ac4c-669226af52ec","resolution":{"observed_at":"2026-08-02T23:23:34.805229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11175","last_updated":"2023-05-25T15:02:07Z","snapshot_observed_at":"2026-07-06T15:29:20.405296Z","submitted_at":"2023-05-18T17:59:42Z","title":"VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11175","snapshot_observed_at":"2026-08-02T23:23:34.980496Z","title":"K., Singhal, S., Som, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.980496Z"},"links":{"cited_paper":"/paper/2305.11175","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:0f92925163cfb454812ed05b91f9917f6aac4878fc01357ba1b2f97e7cc05b3c","observation_id":"bd6dfdfe-4afe-437f-a1a5-f4490fc688d6","resolution":{"observed_at":"2026-08-02T23:23:34.980496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T23:23:35.129957Z","title":"Wu, J., Zhong, M., Xing, S., Lai, Z., Liu, Z., Chen, Z., Wang, W., Zhu, X., Lu, L., Lu, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.129957Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:ecc9e226f14d07e2aec1ca58af02de077fe6aaaab047b7bcdd366c53477157b3","observation_id":"6645d106-7b66-4803-9bb6-a7c6d0e446d4","resolution":{"observed_at":"2026-08-02T23:23:35.129957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T23:23:35.241079Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.241079Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:3072dcdd32e8d6a0691aef0265dcc6d40a1513a0f8fdacb960a03895a4a6a052","observation_id":"e52d6eb0-fe4a-4304-ad84-425e73b3fbdd","resolution":{"observed_at":"2026-08-02T23:23:35.241079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.288627Z","title":"Visual representation alignment for multimodal large language models.arXiv preprint arXiv:2509.07979,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.288627Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:6728072a0c8a2b812bd4f5e0ad1e5f7e2e297468a8ef5df792f5e8be98145153","observation_id":"94644f63-9640-493d-983b-78c3f719e063","resolution":{"observed_at":"2026-08-02T23:23:35.288627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.634650Z","title":"Semantic Segmentation for the Open World","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.634650Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:a13bdd42889b9f728a02c55f684558bc1784271e9c00f7c0f2fbdc1f69a69507","observation_id":"af58203f-071f-47fd-b286-8d4ed74fdd03","resolution":{"observed_at":"2026-08-02T23:23:35.634650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.775714Z","title":"RLE string","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.775714Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:4dc79e29c36279a3e43d0ffa407f55a22621badde2bffad4f34d6063ee8603e6","observation_id":"f7980be9-7a39-448f-b585-91aa30436ebd","resolution":{"observed_at":"2026-08-02T23:23:35.775714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.957580Z","title":"During testing, the predicted values need to be de-quantized to obtain the real depth; otherwise, only relative depth is obtained","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.957580Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:a48af22e000ab683dedc8ede79a6cd787c4022c926cff2a7b170ac8c5f12ec9b","observation_id":"721c078c-2fcd-468f-83c6-d0306fc8ebe2","resolution":{"observed_at":"2026-08-02T23:23:35.957580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:35.913684Z","title":"During testing, we dequantize to the actual depths and exclude invalid depths","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.913684Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:32464d839f08130daabcb94351e376f8b973c119d045159791f19c60979de641","observation_id":"1e295596-64b2-4160-a1f5-c77d0116f190","resolution":{"observed_at":"2026-08-02T23:23:35.913684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.922033Z","title":"Token activation map to visually explain multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.922033Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:8a2427afa5a825078c8101273abe0c0958b76362c6188f4b14f2632a5b4ba488","observation_id":"e449bbf3-80e5-470f-b876-fd81be049334","resolution":{"observed_at":"2026-08-02T23:23:33.922033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T23:23:34.118285Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.118285Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:b04b1798f29990fa1ff3c960f9f24ebfa9d1c499d53df631f59f2c2e5bca2611","observation_id":"1451865a-7c9a-4791-9a06-15a32fff1dfe","resolution":{"observed_at":"2026-08-02T23:23:34.118285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T23:23:35.367262Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:35.367262Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:055ee6add651e80c6d40a38ac04aa8a6bc9dc7909733610453495f74f3f10d21","observation_id":"0872b2d1-4d96-4fd7-a576-8b93f4c585a0","resolution":{"observed_at":"2026-08-02T23:23:35.367262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.985256Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.985256Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:0d623bbaafb8e3c8f6b1eb2b3178438363d410ceca59f320ecc7fe47a4effc96","observation_id":"4008008e-1e56-4c2a-9d80-8aef88889994","resolution":{"observed_at":"2026-08-02T23:23:33.985256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:33.622893Z","title":"Depthlm: Metric depth from vision language models.arXiv preprint arXiv:2509.25413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.622893Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:019d91a74928a3d36afab863306e397e3082ca576611129d89ea1aa3f68f7ddf","observation_id":"ac3b1f72-e304-4413-aa12-aa9b707e7c18","resolution":{"observed_at":"2026-08-02T23:23:33.622893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T23:23:33.484278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.484278Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:efbaf4a8bbf3f3c82c99ef8f9e37836d466802e4e55d507105dd1e1827c7d207","observation_id":"83e0c2c3-6ba3-4fb7-8596-b705792efcad","resolution":{"observed_at":"2026-08-02T23:23:33.484278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-02T05:41:31.119340Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-02T23:23:34.181055Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.181055Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:c1b9997a5c167888663346a007e469b834c0a29a519bdcf377df766f72c6a690","observation_id":"1e66a50c-6327-46c8-b119-652a6d6c6a69","resolution":{"observed_at":"2026-08-02T23:23:34.181055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-02T23:23:33.793070Z","title":"V ., Khedr, H., Huang, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:33.793070Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:65cc916f2848d1c22daee1a634259925f145c4e24847772157a42779b7db60a2","observation_id":"081f0df1-d124-4cc9-abe0-b3032db15574","resolution":{"observed_at":"2026-08-02T23:23:33.793070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:23:34.046942Z","title":"Lu, P., Bansal, H., Xia, T., Liu, J., Li, C., Hajishirzi, H., Cheng, H., Chang, K., Galley, M., and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:34.046942Z"},"links":{"citing_paper":"/paper/2602.14134"},"observation_digest":"sha256:75d9826f06c28f79a1318e5b76dcb6a22ab8796e02a8234e10266e735a99ae2c","observation_id":"c736002b-5762-44f3-92ec-012ce0ce4a4b","resolution":{"observed_at":"2026-08-02T23:23:34.046942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.14134","last_updated":"2026-06-01T07:44:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:23:32.424074Z","submitted_at":"2026-02-15T13:12:28Z","title":"DenseMLLM: Standard Multimodal LLMs for Dense Prediction"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2602.14134."}