{"as_of":"2026-08-05T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:324ad1b568cf5d21ea363db0b83ae46816b8a454ab9d6d9cd3c6113630e04af9","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:04:19.786361Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10130/citation-record","integrity":"/paper/2607.10130/integrity","json":"/paper/2607.10130/citation-record.json","paper":"/paper/2607.10130"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:1c34a134d059b8778965c98ca8edf0b0b2c22637af38832a76b99e79d3bf12b4","observation_id":"c49d803a-166a-4aab-9ee8-05a883b6cbef","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Towards seamless interaction: Causal turn-level modeling of inter- active 3d conversational head dynamics.arXiv preprint arXiv:2512.15340,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:a2891e3a2fc2ecafcb64a81b48edc9778441f481658d8e59ed0e53f7eab49366","observation_id":"dac3c4ff-f9f0-433c-aa03-151599c2cb42","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:2ff76ada7beb8e9dc2c904123a8f3e0cf35cce22ff1293731afea65b2a6e96a9","observation_id":"46ceed83-4a6f-4a54-af25-67775e1a8f9a","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:15ef193a2fa9633cac7bc542e0f3ea1639f33aca643ed8e0b291a582a05d9b44","observation_id":"dbac9967-66f6-44e4-91dd-7d8d5e9f3aa5","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Ma-bench: Towards fine-grained micro-action understanding.arXiv preprint arXiv:2603.26586,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:da71c596f62cfd32cca354865b711091c54e52a3dca72a958bf7081f0475c1cb","observation_id":"17b60ef7-b2e9-4608-b22f-6d40e6a2db4b","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:83e8c3a3f93f76e5ddbe28b6a517839e1b8489e482ec01400365527df1247913","observation_id":"aa8a4dec-f17a-400b-9b61-43fbf92eab9e","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Dinov2: Learning robust visual features without su- pervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:421b6ae7961a8dc86adadcc6aac8640fa36e2c87d4543344f0d41ef23437408f","observation_id":"d443c431-9873-4406-98fd-c00c631786f4","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01557","last_updated":"2024-05-02T23:37:06Z","snapshot_observed_at":"2026-07-06T18:39:47.662209Z","submitted_at":"2024-05-02T23:37:06Z","title":"AI Governance and Accountability: An Analysis of Anthropic's Claude","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01557","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Ai gov- ernance and accountability: An analysis of anthropic’s claude.arXiv preprint arXiv:2407.01557,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2407.01557","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:f04259aa69a0bd194924959658d2f2b88b57b96dfcdc3043d9e5d5b70ee5b353","observation_id":"de2e4452-50d5-4b5e-863f-d90f77253f8a","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Sharingan: A transformer architecture for multi-person gaze following","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:76b3a1a3c39e940206b9a841116b940497e67e4d9fd8c9f754ad3831870539a4","observation_id":"18993df2-4581-4a83-9d36-02e750f91b0b","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Multi- modal across domains gaze target detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:187b9f8392ded65456dd9312a1b46499d4faa7552c056c80ecba7f9025db2d59","observation_id":"2d67d03b-2c92-4c5a-85e7-63e13160a39f","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:0ebe3462a9c7b35c995fece0609f57385a0c208429c1b859bc75165c307311e3","observation_id":"faf481f8-29bf-4153-a006-b5f95a7a99aa","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv preprint arXiv:2309.17421,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:921937b170921291f6a1ed81c491b603d4847cfbfae8ae403d19d68132ce8af5","observation_id":"af2e02a9-1adf-40f2-8bcb-c694c5958f86","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-14T14:04:19.786361Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:04:19.786361Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2607.10130"},"observation_digest":"sha256:27fa932a86f36437154abadfa57bdeb52e9a9113ab3157e87c03f9bc11609267","observation_id":"bbbd632a-a2ca-4ad0-86d9-7785970b71fe","resolution":{"observed_at":"2026-07-14T14:04:19.786361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10130","last_updated":"2026-07-11T05:40:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-16T23:18:12.407744Z","submitted_at":"2026-07-11T05:40:45Z","title":"TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.10130."}