{"as_of":"2026-08-04T12:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f9a657f8e71a7daf991e7ae70f74ccb2f3ba6ccf2c9b4a416a21dc1e8d4d4c0","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:07:55.655699Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:38:51.488742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13633","snapshot_observed_at":"2026-08-01T23:38:51.488742Z","title":"arXiv preprint arXiv:2601.13633 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15374","last_updated":"2026-07-16T18:18:31Z","snapshot_observed_at":"2026-08-03T21:00:43.071180Z","submitted_at":"2026-07-16T18:18:31Z","title":"Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T23:38:51.488742Z"},"links":{"cited_paper":"/paper/2601.13633","citing_paper":"/paper/2607.15374"},"observation_digest":"sha256:282118e1672abe54358d254bf2c3cab271ca4aac5e9bccc1aece1fb9b8067800","observation_id":"69f25467-88b4-4b13-bac1-282fa739d11b","resolution":{"observed_at":"2026-08-01T23:38:51.488742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.13633/citation-record","integrity":"/paper/2601.13633/integrity","json":"/paper/2601.13633/citation-record.json","paper":"/paper/2601.13633"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c5f6c2314a35bdeb0490bffcdf90a73ebe07b0089b9a748ebafbe3a3bb9f752e","observation_id":"a6173652-6af4-4e58-9664-5d89c0a99f58","resolution":{"observed_at":"2026-05-16T13:10:56.734420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"149c46e5-7e01-4598-b358-a1c475aea61b","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d1da236d788db4f69a3aedac208f29752d65e209d3a03ba337831316299c9cd8","observation_id":"17d41e28-cfab-479a-b096-2881c783bb00","resolution":{"observed_at":"2026-05-16T13:10:57.606712Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13450d71-0993-4723-8dad-b53f7640251c","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e39eabd165a2c7500d5dd06acf2838d4a156f00db25f993a5ca2b80e75ab1f33","observation_id":"e3fee928-080c-4cc0-a3fa-6803df9e2f3c","resolution":{"observed_at":"2026-05-16T13:10:57.571737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d6a09f012e5761748d50a8d7fbe5510d8820d9931995c86ef89bc37b9b7282d8","observation_id":"5202c00d-aabc-4b9c-8091-f04881ccb8cc","resolution":{"observed_at":"2026-05-16T13:10:56.749395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"401b4430-13c0-49b4-b0c1-e2e64d5e5aaa","year":2011},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:372080fce57bad0e25130ea15657da90ccfd023930a839f90311b454b808363e","observation_id":"bdb57217-bae4-4d4d-a551-d3b7f0b7a0f6","resolution":{"observed_at":"2026-05-16T13:10:57.601763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"75f57006-0a62-4b62-aaac-6ff22b80e5c7","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d3f8bf4a95de14a0b0dfa16fa68dc8ec675e3b3c77373a9814ddcc6a17b3684a","observation_id":"9374484c-766c-47a3-8528-315e8d0bfa21","resolution":{"observed_at":"2026-05-16T13:10:57.583624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:02:56.079865Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"2d7b400b-4ad5-49cc-8638-2338105f26ce","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:19d690c37bd7fa837b784c2572d3a4da7c61a50ffc4c1c24bc0d8dc87f72dc44","observation_id":"f557b503-347e-4997-8c4d-7c825f3316bf","resolution":{"observed_at":"2026-05-16T13:10:57.588840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:16b7e322749c5ea8ee8982211294c9c25b8e08db95d020250ea7b1b693643aba","observation_id":"73c063f4-5930-464d-98eb-6750b130d49f","resolution":{"observed_at":"2026-05-16T13:10:56.731528Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints pp","venue":null,"work_id":"0b34a146-4cec-491c-a0fa-7549b0d2a4e2","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9d0d0a664354e789566f197ce8f913658ad95c10919497c909ed98ae7b9fef64","observation_id":"9145da1d-2f48-4990-93b3-964499d31458","resolution":{"observed_at":"2026-05-16T13:10:57.616917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints pp","venue":null,"work_id":"31b60115-5db1-48e2-b461-0fff9d47aed9","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:eda7d81afd11235e612c1c926818aa28f2903632579d52b951ebf53aff9c5998","observation_id":"e871a1c0-4d5f-4179-afeb-a96f3ce206c4","resolution":{"observed_at":"2026-05-16T13:10:57.596770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Ad- vances in Neural Information Processing Systems (NeurIPS) (2024)","venue":null,"work_id":"91cf253c-6e46-4d3c-a969-54b2832b5b10","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e77a360f952e3b373cd15f3c95499d92c4da5c015b6cefd27bb548ed705ece6f","observation_id":"2033dc5d-a4ba-41ff-8e0d-01fa538263d6","resolution":{"observed_at":"2026-05-16T13:10:57.568872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9d28850892e581dae07f7dfec1d4365f5c3def1d5d0efa1a1cbc035e50376970","observation_id":"ce7bc1b4-cd7e-4b0f-9a93-7db533d80b9a","resolution":{"observed_at":"2026-05-16T13:10:56.719054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12433","last_updated":"2024-04-02T18:09:22Z","snapshot_observed_at":"2026-07-06T17:05:31.586924Z","submitted_at":"2023-12-19T18:58:40Z","title":"TAO-Amodal: A Benchmark for Tracking Any Object Amodally","version":3},"cited_work":{"arxiv_id":"2312.12433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12433","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2312.12433 (2023)","venue":null,"work_id":"58bbbe8a-8588-47c9-9c5c-ec65dfe977c4","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2312.12433","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:7a29b4516cd398f183481a3198793a51ff1b205ad550ffcfd0def67d9f2aeb31","observation_id":"ab5e14a9-a4d5-4f02-aad9-42cfe5919bcf","resolution":{"observed_at":"2026-05-16T13:10:56.714909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:280bb1833f54604c1d693be41138af298d31f1e0fd2ee67a7e5340aab46a2673","observation_id":"ea035e0a-1f92-4a7d-98e4-9ff029116b21","resolution":{"observed_at":"2026-05-16T13:10:56.725695Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Psychological Research88(2), 307–337 (2024) EGM 17","venue":null,"work_id":"a9192712-149b-4ed0-aad9-b94ea00413e6","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:6d7eb58dff2bc1d50b12aff4f01b78626832e319727fdeb9d584805c715565c8","observation_id":"3aba5604-d2d8-4a51-a8a3-0161ebcdfe5e","resolution":{"observed_at":"2026-05-16T13:10:57.614041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 2014 conference onempiricalmethodsinnaturallanguageprocessing(EMNLP).pp.787–798(2014)","venue":null,"work_id":"a862aed8-37d8-4d50-82f5-e47390a5317c","year":2014},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:0aec32a2670ecd229c273a4d13020bd7c2f990493b4a27a8a1c5cc36c41c3127","observation_id":"4b004b11-4843-495d-bac8-1d1f29523eea","resolution":{"observed_at":"2026-05-16T13:10:57.604327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208428de-30ce-4548-a4ca-2aa11981856e","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e78a19562de00d039ebb706ebea26536fc5d8079714d48aa3b81cc850116b7e2","observation_id":"27bf4157-3794-4325-9f68-d34c245c1a6a","resolution":{"observed_at":"2026-05-16T13:10:57.610286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles (2023)","venue":null,"work_id":"00425924-e417-411f-94b6-b23f98e447e0","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c1df588bd67466a2beb5be6a1e7df32295fdc58f0303bb4eb2f94dd253ecffb2","observation_id":"06dab8fa-903d-4831-8a6d-40dd5ef4b1a7","resolution":{"observed_at":"2026-05-16T13:10:57.611850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9060f833dbaadb44895ad590575e98bfbda5ae3dfc21bb4c7d4a1d8f9eac1ced","observation_id":"69071cf1-ea2a-41f0-b636-c806130a04da","resolution":{"observed_at":"2026-05-16T13:10:56.737621Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV)","venue":null,"work_id":"2df69d8c-5e40-4a30-b8b6-75b27848957e","year":2016},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:f67ca34bd792b8b72ff26257641eabea2b8f097b41801d7f99a44673f90a6ef1","observation_id":"a0e41b03-23e4-44f4-9025-879840fce802","resolution":{"observed_at":"2026-05-16T13:10:57.619094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision","venue":null,"work_id":"9177d3fb-60bd-44a4-9feb-8bd55c130030","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:a6a5f4cf507e9b2fc925ef9d81935d03453919936c841e1cf705d3fafa09fdd7","observation_id":"a42441e3-423f-4393-8f34-56d2fa134908","resolution":{"observed_at":"2026-05-16T13:10:57.621580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV)","venue":null,"work_id":"0ea5581c-940f-49d7-a7da-a1b86fc0ba88","year":2022},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:1e204d71209a4238a65c253d898f14d68f774c33f4223f1dc0617d8c71c63263","observation_id":"cd6dc917-a95e-438b-a24c-b981569f3c02","resolution":{"observed_at":"2026-05-16T13:10:57.591576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Multimedia (MM) (2023)","venue":null,"work_id":"7dd37ef3-bbec-472c-ab17-a0abf1ecf7ea","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c1babc492aa4c652c2bc2e49047233ad39ac64ca6b80891fb0562d3eb1ec7552","observation_id":"fff80151-937a-4af2-bd96-e9fe936685d6","resolution":{"observed_at":"2026-05-16T13:10:57.623745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"c41795a9-b4ab-447f-af6e-691c97a67b06","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:8b5f7d40d5117562a3c34f99c4257fd3cdf0bd224c9577c37d4942d091f294da","observation_id":"1d09fc3b-caed-4dd3-8d68-f08324997b17","resolution":{"observed_at":"2026-05-16T13:10:57.625998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:20:43.363972Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"33dbbad5-4b0a-4a6c-a878-325800bcfeaf","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:4794b893e5d02bc28b5e2f1f013c84c7c5eceaa387df7e11123a96c43c1dd550","observation_id":"8e0eb2c0-3a9e-48f4-b9aa-3da62be6e593","resolution":{"observed_at":"2026-05-16T13:10:57.586577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"1a777dd2-948e-453b-84b4-cdbd10734c5d","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:87dafc089194db404ad5a609926937676870dfd34b52606bbd77ce4c0513c99f","observation_id":"16d83e56-4db8-439d-99a5-6d4e170db180","resolution":{"observed_at":"2026-05-16T13:10:57.587743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"eef0a6a2-7c42-4601-b5f7-d5444a36b691","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:f5940320b7b0f338c87543bc3496a705bc1480e0c164df938be3e3960126223f","observation_id":"db26aa49-bdb0-4431-a281-a926174af312","resolution":{"observed_at":"2026-05-16T13:10:57.593569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"c2d25ae5-055a-4b12-b781-c36d57091221","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:5d09f404dc893aa5d662f59744c099190d0ff625830bf806aca5b72033bb0f97","observation_id":"ed0eae98-da38-42de-be17-6a7d87ad7f8d","resolution":{"observed_at":"2026-05-16T13:10:57.609352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"f59bdd3a-993c-4f22-a77a-3189548a9be8","year":2016},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c7bc73cd588d8d99e99366dd0bfebd7f4f4ac73565843b39374e9ba7d8c5700d","observation_id":"20af6d65-1e89-472a-acd5-e58e16de1f38","resolution":{"observed_at":"2026-05-16T13:10:57.591288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:10fec4386f9ebb48cd6326722ca60d3061e610cef536e5380b89a76755febf33","observation_id":"788a646b-dc6b-4146-8462-0d85452d4fd6","resolution":{"observed_at":"2026-05-16T13:10:56.706873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:911adc1e536cc0b021f3ebaf34449ed73ebd109120c87af7f57c7c4ddd02bf61","observation_id":"b8b534b6-04cd-42bf-b771-754bf3d6eb09","resolution":{"observed_at":"2026-05-16T13:10:56.740725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c257e3ddadb01e2a6e0a41e291e63fa375648f6bf01a2eb8addca84137174bf3","observation_id":"a39eb763-a5eb-4593-9e5d-205bccb1c8a0","resolution":{"observed_at":"2026-05-16T13:10:56.722822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:652a77dd463e6fa5b79700e1732235a6d4991009a37e5111474bb0c30553a9ef","observation_id":"80558958-e0dc-4f5d-848f-b8ac3e96cea6","resolution":{"observed_at":"2026-05-16T13:10:56.728483Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:bcf55f5689389aba6a6f905da9a4a796a1f5fa541bfcec8734166848ffeffd6d","observation_id":"650fd6b2-170b-4c43-ab65-78ef70da1454","resolution":{"observed_at":"2026-05-16T13:10:56.746512Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:fee6be13f34f76bd6d5fb39781ac2db0445831ea6086dab76b42211c8fe12991","observation_id":"803bb090-7124-412a-ab9f-4a258a95aebc","resolution":{"observed_at":"2026-05-16T13:10:56.743529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e5e7dc179a20badcd931b3459324fcdac35eab4d8c497b477911ef85ad238583","observation_id":"6c83cf21-5767-4c75-b8ee-c9aae01b99e8","resolution":{"observed_at":"2026-05-16T13:10:56.702965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:07ddbdf4e8d783665c5679b7057f446fa3e97596a5149220d996e8a2d0d2fa14","observation_id":"6a1c0a8c-c229-4107-baab-02f1846fb20c","resolution":{"observed_at":"2026-05-16T13:10:56.689386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:805cb53af41c8032e44236cfa5e2ddd0770382cc60d1efc1af43536c9bb4523a","observation_id":"0af3fd9f-14c7-4f89-8c2d-17653cc9f45c","resolution":{"observed_at":"2026-05-16T13:10:56.692513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13439","last_updated":"2025-03-17T17:59:01Z","snapshot_observed_at":"2026-08-04T07:48:44.918544Z","submitted_at":"2025-03-17T17:59:01Z","title":"Amodal3R: Amodal 3D Reconstruction from Occluded 2D Images","version":1},"cited_work":{"arxiv_id":"2503.13439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13439","snapshot_observed_at":"2026-07-09T18:06:25.624991Z","title":"Amodal3r: Amodal 3d reconstruction from occluded 2d images","venue":"cs.CV","work_id":"5f1e6774-4328-400b-9d6a-928495d17d40","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2503.13439","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:fc1872c0d644a9229233afb7257ae03a8ba2e8c2bb40f5382d21559d22af80dd","observation_id":"83fe5f8f-d0e0-4606-8235-a429a6b25ece","resolution":{"observed_at":"2026-05-16T13:10:56.707028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision (IJCV) (2025)","venue":null,"work_id":"b296bf78-1f66-4bc4-86e3-6ddb2db89605","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:b3494d669c708599ef23c72aeaaea190ec8dda4b390ca092bdc64b88d5fb1f2b","observation_id":"8b77253e-ecc1-4f49-b04e-4492587c300c","resolution":{"observed_at":"2026-05-16T13:10:57.602387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":"edfc3ece-28cb-4f89-bb0b-40d088249642","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:98b3100f23fa1eedccaaa8d6244a53c1bf683f9afa36c1c667a1b165cd31026e","observation_id":"2ff12b36-d25e-415f-ab4b-1d8e48e5c6ad","resolution":{"observed_at":"2026-05-16T13:10:57.571957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9ee9f4b51f6f18b93ea562be0d566d7a8cdcce15e74f4965c2eecb1d7af3d550","observation_id":"50020c9f-6b63-4e53-82b8-2848c2951df9","resolution":{"observed_at":"2026-05-16T13:10:56.699161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE International Con- ference on Content-Based Multimedia Indexing (CBMI) (2025)","venue":null,"work_id":"ff0a71b7-a09a-4b3c-bcea-dbe7c74dd658","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:ab46ce5db86dd69f04dcf2830f82e633eb585a592d34287f9c6c50b60a910284","observation_id":"37434e43-ec97-4df6-bc82-056928281abe","resolution":{"observed_at":"2026-05-16T13:10:57.574891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024) EGM 19","venue":null,"work_id":"a41d0cf9-39bb-4393-b0d3-d7c53e07e868","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c7ca85b4d6626cd3047ab483083127b0fc57e8a1a4092bb94c4902275c4d1e93","observation_id":"f473c917-b39a-41e4-b6e5-69eecd34e16f","resolution":{"observed_at":"2026-05-16T13:10:57.577825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"42006b06-4df3-4637-bfdb-ff7f096b8b84","year":2020},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:020ec83b051d1907475ff5ad2068cdc3c1550dc036ed63436800de237cbbc3b5","observation_id":"7ccb2ba9-ea63-445c-9ee6-61086bb3cab9","resolution":{"observed_at":"2026-05-16T13:10:57.566424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T03:17:51.831519Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:efc8f1febda6464b96db6e67e5cefe2f75294cdb313a842ee45ddc1b6fb9a2a9","observation_id":"baba472e-15bf-4990-85a9-1516a91fb7fa","resolution":{"observed_at":"2026-05-16T13:10:56.685410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{question}","venue":null,"work_id":"770d1ff2-dd51-4b56-b6e0-bbe3aef26d2e","year":2017},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:74fe644f39f6785143bf92370a91f7e406e64e7e8c5337da286124d7db1a621a","observation_id":"cd3f772e-aa3d-4404-a03d-94a822547520","resolution":{"observed_at":"2026-05-16T13:10:57.637127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1938c1e-9e97-4c92-a81d-fe0096ce0c78","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:6e3357b4b4e2980ebe02cafe8be548aa1a8d5b1ff887ec59bcfc38941e9fc608","observation_id":"6547ba3f-a7f1-41d0-a6a7-0e4923cb688d","resolution":{"observed_at":"2026-05-16T13:10:57.639128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the second/third/fourth xxx from left/right/top/bottom","venue":null,"work_id":"f37bd02e-a963-472c-9686-73faf94b1c5e","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:58e0efeccfaee977411053d74a4715f0d49feb22db2b94590267f534600c02bc","observation_id":"8561e2fc-8969-4e6b-8df1-291603d19f4b","resolution":{"observed_at":"2026-05-16T13:10:57.563719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bebb2faa-228e-4760-b408-0651be8c1401","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:75cf4d59e0a7d86d69df7832140df2e02e644565d0356ae252a45e241c922f08","observation_id":"1a4f842c-8da4-4839-858b-6b76bc1b02dd","resolution":{"observed_at":"2026-05-16T13:10:57.628153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the man in yellow coat","venue":null,"work_id":"5ec1382e-f15f-4a2b-b2a9-672901888969","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:02871c3ffcf6a0521f57e32d548ba8342aec37bb581033f6a53c3545e4950adc","observation_id":"9b543d76-e20b-4fb0-ab13-39313e2e9c80","resolution":{"observed_at":"2026-05-16T13:10:57.630277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1454bf0a-fc91-4a23-8c69-3110ed3c01ed","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:f3ae131550fa6583931e361373c1c2386bc3f9b1c5ff44aa41f13ee7da7d6e8e","observation_id":"55f4ddcb-abfc-4e38-8cc2-385938014c2b","resolution":{"observed_at":"2026-05-16T13:10:57.632503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"567e452f-d26e-496b-9405-6c243c2914c8","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:acbf878cf68fccd17aa4f7f1895b519c363c7b7cdb231cc830e702efab048e58","observation_id":"bc65e258-d994-48fa-9b7f-79a6ae81e0da","resolution":{"observed_at":"2026-05-16T13:10:57.607436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"YES\" if the description uniquely and accurately identifies the TARGET region -","venue":null,"work_id":"009f843b-3971-4544-a430-f7e198fa248c","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c95574be472b2b16e5aa883d5ff03efc827875c5e45089a0c2bde8ae5cf6eeb0","observation_id":"dfd2ddf3-682f-4c5c-acea-c1095bbb4296","resolution":{"observed_at":"2026-05-16T13:10:57.634900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d305292-7878-4571-ad7b-196fec27245f","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e73654556d85a8bdb67422b6f5b6eea0f7d25cd8d22bbfcb90b0a1f69fc7c972","observation_id":"d165cc06-722f-4a60-9f3f-a43aa7955017","resolution":{"observed_at":"2026-05-16T13:10:57.550405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6444d326-9b12-4806-b5ab-f166c6ee2df7","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:b16e96e4ba28075e30f05a2e2503fef222b0a55da283bba626325507c01a1bdd","observation_id":"eee4c9f9-958f-4392-a0cf-4f7d002a1a8d","resolution":{"observed_at":"2026-05-16T13:10:57.552967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65b0ba5b-80da-4dd7-9f60-6209c71ae47b","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e9971a2042350bd5cb809a1366e733099b0e42deb17691d479ee4cbff3830d09","observation_id":"57899d1d-061d-4301-93af-3c2633546d67","resolution":{"observed_at":"2026-05-16T13:10:57.540048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"slightly","venue":null,"work_id":"9e93f255-15ab-4414-9085-177f4061985f","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e541a0def00dc6e896bdca99da7d39c4690187672e648f9c2679fea114015cb8","observation_id":"2021a286-609b-48c4-8ad6-d0ee04cf3821","resolution":{"observed_at":"2026-05-16T13:10:57.542633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"sofa against the wall","venue":null,"work_id":"1faa5b5b-a27a-43f4-b6b3-a07cabf0b36d","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:60b1ef8894534725622ba4a360f875c737bd5d82662a509b7123eb0af20b0454","observation_id":"4c51ddc9-50be-4398-a342-23277cb24cd0","resolution":{"observed_at":"2026-05-16T13:10:57.537439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":1,"unresolved":10,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2601.13633."}