{"as_of":"2026-08-06T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fd4c3a1abf4a37d60943a8ee597ad7c61ddb80bee85cdcf3129d3341c17945f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T14:19:34.622854Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:17:12.549851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T13:05:45.066160Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-08-04T06:17:12.549851Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02599","last_updated":"2026-07-30T16:56:40Z","snapshot_observed_at":"2026-08-06T21:10:10.145795Z","submitted_at":"2026-02-01T17:15:40Z","title":"RAP: KV-Cache Compression via RoPE-Aligned Pruning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T06:17:12.549851Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2602.02599"},"observation_digest":"sha256:afab445c46706dd4eed3c64034207739ecadbba41ae1996ed741716eed73c7fb","observation_id":"3fa80d22-adfc-48f5-88a0-06a3fa545159","resolution":{"observed_at":"2026-08-04T06:17:12.549851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2505.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-07-01T13:05:45.066160Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":"cs.CV","work_id":"ffb54ac2-2be3-4399-8e16-e0eb60917ffb","year":2025},"citing_paper":{"arxiv_id":"2604.12537","last_updated":"2026-04-14T10:12:24Z","snapshot_observed_at":"2026-08-02T07:44:20.902285Z","submitted_at":"2026-04-14T10:12:24Z","title":"MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:02:34.007217Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2604.12537"},"observation_digest":"sha256:87f5cd2fe44ba0af2a8ea7ef8aba5619bdc36a84958f762854a2524b80381ce5","observation_id":"a17295a5-fcef-4cf8-8c07-f730491a2d67","resolution":{"observed_at":"2026-05-22T02:03:47.153387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2505.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-07-01T13:05:45.066160Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":"cs.CV","work_id":"ffb54ac2-2be3-4399-8e16-e0eb60917ffb","year":2025},"citing_paper":{"arxiv_id":"2605.01191","last_updated":"2026-05-28T05:36:20Z","snapshot_observed_at":"2026-07-31T08:36:15.324584Z","submitted_at":"2026-05-02T02:10:54Z","title":"Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T01:10:48.111387Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2605.01191"},"observation_digest":"sha256:05661f02dd9d88d60d06ea6d7a639dc0efd7f33c0555ff670713f708b7179704","observation_id":"8adb6880-4177-47d0-9622-fe1d16d75d9d","resolution":{"observed_at":"2026-07-01T13:05:45.067720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2505.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-07-01T13:05:45.066160Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":"cs.CV","work_id":"ffb54ac2-2be3-4399-8e16-e0eb60917ffb","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T02:14:59.487486Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:26839bf5bc17e28fcda6e8ca1bec25248e5ed365082f29a86a691e476512353a","observation_id":"9cf1f5d4-1cb6-432f-bc33-1fe085cbacad","resolution":{"observed_at":"2026-05-22T02:03:47.153387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2505.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-07-01T13:05:45.066160Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":"cs.CV","work_id":"ffb54ac2-2be3-4399-8e16-e0eb60917ffb","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T21:47:32.112057Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:ee52d71c635cbd076ca34a26175a9fa1d9ba2d5ac5ea44abd48895b8c20b481d","observation_id":"cbc14466-2750-401b-83d6-019f212d1863","resolution":{"observed_at":"2026-05-22T02:03:47.153387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2505.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16416","snapshot_observed_at":"2026-07-01T13:05:45.066160Z","title":"Circle-rope: Cone-like decoupled rotary posi- tional embedding for large vision-language models.arXiv preprint arXiv:2505.16416, 2025a","venue":"cs.CV","work_id":"ffb54ac2-2be3-4399-8e16-e0eb60917ffb","year":2025},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2505.16416","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:be04b51435f4d2d889823b1e40d82b90b359fd40d1f0eb3367d8ae7c8cceb4a8","observation_id":"b29f0c5d-5e88-4d88-a178-75f94fcd5ca9","resolution":{"observed_at":"2026-07-01T10:15:44.837433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16416/citation-record","integrity":"/paper/2505.16416/integrity","json":"/paper/2505.16416/citation-record.json","paper":"/paper/2505.16416"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:b88bac515ffd019cce2274766dc0439b22980401bc7ca06117a5912ecf5d9faa","observation_id":"be3155ce-62be-48fa-b442-2733e97c150a","resolution":{"observed_at":"2026-05-22T14:21:39.716042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:436e873d70b3c0ed8af532a6ce3a33d0ee0ba90b4963cd6b483edf86ae3e43ed","observation_id":"99a3544c-aa83-4909-8c4e-2ecf90561e91","resolution":{"observed_at":"2026-05-22T14:21:39.720635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:0cf225d5a946620285b178cc589ed13cf198d089a0be2f99479c101f8fbd4e17","observation_id":"296a26b6-e263-46aa-a12c-60b1eb267054","resolution":{"observed_at":"2026-05-22T14:21:39.692249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:ff7509717fe61607d04a62e62b262220864c9bc1f895bc32391f459535ca1cc4","observation_id":"050d2c3b-ca16-4e0d-857b-5540d678d2de","resolution":{"observed_at":"2026-05-22T14:21:39.737877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:f9fc8a6d28cabe8c1db30d1fa2deda4cf8f0e74cb2f4fe284f0af8b7df67025f","observation_id":"b2028d01-687a-41f2-a5b2-7f76926d2d2b","resolution":{"observed_at":"2026-05-22T14:21:39.726967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-07-06T18:47:08.782799Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":"2407.11691","doi":"10.48550/arxiv.2407.11691","metadata_source":"pith","pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":"cs.CV","work_id":"c639e7fb-11f5-459a-8942-659daa5ac1d8","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:1758347734ec90785382f425c5d64ff5f421e3a4e152119c181be65cf112a65d","observation_id":"d21366e8-78ce-4120-92db-4a02f47b2928","resolution":{"observed_at":"2026-07-07T02:19:36.652705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04620","last_updated":"2025-05-07T17:59:32Z","snapshot_observed_at":"2026-08-03T14:33:49.497365Z","submitted_at":"2025-05-07T17:59:32Z","title":"On Path to Multimodal Generalist: General-Level and General-Bench","version":1},"cited_work":{"arxiv_id":"2505.04620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04620","snapshot_observed_at":"2026-07-01T23:06:21.338407Z","title":"On path to multimodal generalist: General-level and general-bench","venue":null,"work_id":"f682a094-9433-46ea-9dce-42c7c417fd1c","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2505.04620","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:678ba4de654b06f103fddcd5bd6677512c739b26edd87c4771449a1db6eec781","observation_id":"2b532ea4-62d2-495c-80ce-b2bdeed8c3b1","resolution":{"observed_at":"2026-05-22T14:21:39.794474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:bd10a2664ad4ed03c74a802f678a1821b8e54d3f5032f9bc77bcb16f9d813036","observation_id":"703e8ac5-584c-48aa-bd45-2f71d209e61b","resolution":{"observed_at":"2026-05-22T14:21:39.771573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"69e530fd-1711-4c51-a9fe-6e00a0635fd4","year":2016},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:26ce6bccb9cd06d48d29d70e9b10edb3b6ffea6ec6570fdfe3466b88989df502","observation_id":"622429d7-7447-466a-bc82-9128e192904b","resolution":{"observed_at":"2026-05-22T14:21:40.161567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10462","last_updated":"2025-04-14T17:50:20Z","snapshot_observed_at":"2026-07-06T21:09:11.849712Z","submitted_at":"2025-04-14T17:50:20Z","title":"The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer","version":1},"cited_work":{"arxiv_id":"2504.10462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.10462","snapshot_observed_at":"2026-06-29T13:33:28.015082Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":"ad1dd878-7ad3-4bb4-9aeb-d80b89cc76ac","year":2023},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2504.10462","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:b6a7b07ae0be5e4c944ff34a905d0091938d17ef9ef51b9ff6944192d2aa363d","observation_id":"97348b64-4114-4889-9a2a-b871dc941f75","resolution":{"observed_at":"2026-05-22T14:21:39.804522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer-based visual segmentation: A survey","venue":null,"work_id":"d1277ab2-2011-4886-a1f6-24650073d317","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:de03b71ef9c51d630d6a28e25bf7d5057d54935c597d09c4ce032a9a31494505","observation_id":"d5ca492b-1455-4894-9c1a-f14b39c3a1ca","resolution":{"observed_at":"2026-05-22T14:21:40.158297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.284405Z","title":"Baichuan-omni-1.5 technical report","venue":null,"work_id":"d2c9e57e-0e5b-4999-b035-ef159319e83d","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:2d09f03677147caa32b856746e83eaae2e5bcd9e0363e914c6f7f260ae208bdb","observation_id":"823798cf-2643-4c61-8cfa-936ac8ae3ada","resolution":{"observed_at":"2026-05-22T14:21:39.704589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:cdbf2809568ad6229001772501558395cb9d096282b46fe356e4eda225a222b3","observation_id":"74310671-fa47-4a38-a913-840134086350","resolution":{"observed_at":"2026-05-22T14:21:39.687079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:22f1f561e49b18513ccebf5c3a0dc396531eb413af849053922d90e6f80bc9c2","observation_id":"42de5efa-0cb5-431a-83ba-d78fd3927afc","resolution":{"observed_at":"2026-05-22T14:21:39.732552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:c992cc1b4311144074d080b686230a8d40982b631729a16619f6a415c26bc4e2","observation_id":"bedb7fab-876e-4f26-929d-834c6f0dda3a","resolution":{"observed_at":"2026-05-22T14:21:39.829730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:bde05582394442cb8cbcaccb9f0a978a864f5bf4b0b85f70a50353d50d501f17","observation_id":"76420bee-e81f-491f-86c1-0dd85a6789b6","resolution":{"observed_at":"2026-05-22T14:21:39.788591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-07-06T11:03:46.487721Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:b1d503bcc7134f1132086f059f4820fd3bdbd4bfbb151eaeb01ad78897476efd","observation_id":"27d21c87-cfb0-4cf0-9ce8-3a1f3b7b226f","resolution":{"observed_at":"2026-05-22T14:21:39.835811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:86cd827b56857e80e8940ca047ba9d369fd5fa5a914e8ca7f73795cfe7d3a17a","observation_id":"4a5a7488-3a23-49d7-8382-328a111d4aa5","resolution":{"observed_at":"2026-05-22T14:21:39.710173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:d792655bf23b73a8b5807d8e2741ba82901184d7e557634e0f3170cd4b61275e","observation_id":"a4698198-98de-4154-8165-dc4cbc530d78","resolution":{"observed_at":"2026-05-22T14:21:40.164892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:ae6afdf65dd07369c96c00159ec22d778d00ebc082b9ccf1819a13127b385755","observation_id":"960d2ccc-21ba-43c8-8c42-92b1a788810a","resolution":{"observed_at":"2026-05-22T14:21:39.743572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:cea11d618c42d77d4f8f96e1c2bc3dfad085d0f2ee2297afddc68f22ec32e24c","observation_id":"73719d88-6bd1-47d4-87cc-2276caa773d2","resolution":{"observed_at":"2026-05-22T14:21:39.819559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":"2502.05173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-07-04T06:39:37.598350Z","title":"Videorope: What makes for good video rotary position embedding?","venue":null,"work_id":"ef789cf9-0d4b-466b-a27e-ba36dbf5377f","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:d72ef36c7d9e1daf24d5b2d04807b70f715ad8ba16d58c9fb54722f89b3c0eff","observation_id":"a78a7883-6d7d-4472-902f-582dae61d412","resolution":{"observed_at":"2026-05-22T14:21:39.810267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:4349bf878c0572592954627f4da65eb0f9d8e145da5a52506a3f2cc19cbacda4","observation_id":"7a351f35-fb6c-44bb-b844-ce62efad7530","resolution":{"observed_at":"2026-05-22T14:21:39.799625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview.https://x.ai/blog/grok-1.5v","venue":null,"work_id":"0fd14c32-81d8-4c8d-8bc7-2bcfa55de366","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:870ef0299889241fef4bef3414ce023166bf30c8bc641d90af77db50655ad75b","observation_id":"e53f9576-cd13-4120-8856-d0129d3a0d11","resolution":{"observed_at":"2026-05-22T14:21:40.172125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:9a35e4a6c53312ac981517e2a1f2411d7c4fe56dff9abd0e93bd2c0c361e8142","observation_id":"1866e258-2d55-448d-b56c-dbcb34d455ad","resolution":{"observed_at":"2026-05-22T14:21:39.814756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.04840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-07-04T03:19:31.849614Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","venue":"cs.CV","work_id":"6fde0828-1494-4a4e-8aec-3747de70602e","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:9710d7d98ef19f29b07599d9287771f4b5453418c5a0ffe250ec2aec5a9835b1","observation_id":"0668538a-cf7b-40e9-a8cd-75764d2ee628","resolution":{"observed_at":"2026-05-22T14:21:39.824392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":"2501.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-10T03:06:43.598138Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":"cs.CV","work_id":"fbffda10-106c-432c-b84e-5d0908666921","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:20217db897fe1a3d811ae5c7b913fd379390a2f1dd3840aa6d1dddc71eb1d4c5","observation_id":"9a31ce4f-9beb-4920-89ad-5d56ac396aff","resolution":{"observed_at":"2026-05-22T14:21:39.754537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"b7d4cbd6-1d28-48a1-bc2c-08570d58cce2","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:f956d6657ac899c2fbe40fcf21eda714ee114badf3f6a82c9ae4f54e438c9568","observation_id":"82e1864c-7d36-43f0-a806-d9d4663d0c17","resolution":{"observed_at":"2026-05-22T14:21:40.168553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:089db67d18317fa8da1f0e99ffd9768626a14c70b1a0958bb7f18bda06d16a0e","observation_id":"fc562104-9b98-43ea-937c-f9a34300c4a6","resolution":{"observed_at":"2026-05-22T14:21:39.782161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding","venue":null,"work_id":"560f8331-6c04-4008-b2d8-9f99dc5a4d8f","year":null},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:ba586282a17ffe4be4b263a5395d6c43bde76fc1a9f69b19928ec3af763631d7","observation_id":"38a3333f-6f02-4b51-b56e-9b78381f26e0","resolution":{"observed_at":"2026-05-22T14:21:40.176227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-07-06T21:09:17.062196Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":"2504.10465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-07-04T00:49:18.024069Z","title":"12 Preprint","venue":null,"work_id":"91b7e3be-bdd3-417a-af20-52b191496631","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:cdbad4e66921ee491a9cb3d783ca4a5b4d74ca37c6ece307a784c99a1aa384e3","observation_id":"d43770c4-9261-42b9-901c-4092cd57a8e4","resolution":{"observed_at":"2026-05-22T14:21:39.749504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":25,"verified_fuzzy":6},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 6 inbound Pith citation observations for arXiv:2505.16416."}