Pith. sign in

Paper Citation Record · LEDGER

Pix2seq: A Language Modeling Framework for Object Detection

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2109.10852.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2109.10852 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 28 of 28 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:25:41.630304Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:29:57.509967Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation b2bc0035-cad0-45d2-9898-aa2b889484f4 · inbound

PaLI: A Jointly-Scaled Multilingual Language-Image Model cites this paper.

PaLI: A Jointly-Scaled Multilingual Language-Image Model Pix2seq: A Language Modeling Framework for Object Detection

Reference 126

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T09:29:06.060099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-16T09:29:05.956863Z digest=sha256:b819e2671e463ff1923436eecca50ed5be8fbf0ab6ce6cd4b29624535378f771

Observation f64e0af2-a489-4db7-8691-5181f8745e60 · inbound

Kosmos-2: Grounding Multimodal Large Language Models to the World cites this paper.

Kosmos-2: Grounding Multimodal Large Language Models to the World Pix2seq: A Language Modeling Framework for Object Detection

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T05:19:47.994723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-12T05:19:47.907355Z digest=sha256:482fc19ddd309ad35f89c447fa163983c4bb57f28bff766fa0a9418a44fe6163

Observation 8983684b-913a-40e2-a290-e8fafe5acfde · inbound

GPT-Driver: Learning to Drive with GPT cites this paper.

GPT-Driver: Learning to Drive with GPT Pix2seq: A Language Modeling Framework for Object Detection

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-15T15:05:32.021160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T15:05:31.928650Z digest=sha256:0ffff48daf5e5fd494f8372cbb060a4438e05014a8132aebdc3ae9cb022bb774

Observation b5e2380d-d81a-4911-813b-a6c92648deb8 · inbound

SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents cites this paper.

SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents Pix2seq: A Language Modeling Framework for Object Detection

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:09:46.513448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-17T10:09:46.447508Z digest=sha256:7de247364ab1b4d48af1d9e09b0aa741e6393347a401212a96d2a0eae08dc217

Observation dd8a690e-70a4-437f-85bd-de50ae779a77 · inbound

Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks cites this paper.

Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks Pix2seq: A Language Modeling Framework for Object Detection

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-11T06:20:16.170336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-11T06:20:15.656356Z digest=sha256:d98f29ac94cc6428a066e93906ef5e0a01718a34599fce590f9e744d7a58f907

Observation 7b6af6b5-3c5b-452f-bc2f-01a6769cbc49 · inbound

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation cites this paper.

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation Pix2seq: A Language Modeling Framework for Object Detection

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:12:26.047201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-17T16:12:25.980853Z digest=sha256:337cb81a690210aaf6ad6fd36aee79602429b9af9cd6df6778dd8cac2e33ff5e

Observation 7695381b-dbd6-445b-acb7-586bd352201e · inbound

VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion cites this paper.

VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion Pix2seq: A Language Modeling Framework for Object Detection

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:25:41.630304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:25:41.630304Z digest=sha256:097564978e1927dc6e3cedfb0597ffa662fe8dca0f5012044b27894b50a44ea3

Observation f4ebd5fc-10b3-48ac-9858-681f8a890aab · inbound

Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning cites this paper.

Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning Pix2seq: A Language Modeling Framework for Object Detection

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:14.624177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:55:14.624177Z digest=sha256:f1f3651703f38267e1f09c0f62c3a4ab7b193276a33bc3f8146e44fc87150d34

Observation 1ed01301-9445-4456-81db-66c82418bb95 · inbound

ParkFormer: A Transformer-Based Parking Policy with Goal Embedding and Pedestrian-Aware Control cites this paper.

ParkFormer: A Transformer-Based Parking Policy with Goal Embedding and Pedestrian-Aware Control Pix2seq: A Language Modeling Framework for Object Detection

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:42:22.232547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:42:22.232547Z digest=sha256:ff9a565cfff6d2852c4ce27ff6afb63c21c02dff092898917f4eeb63b53f2fb5

Observation e6316a38-2a01-46b3-ba27-c207979b9568 · inbound

Style Transfer: A Decade Survey cites this paper.

Style Transfer: A Decade Survey Pix2seq: A Language Modeling Framework for Object Detection

Reference 259

Resolution
unresolved
no resolver link, observed 2026-08-06T23:13:27.661151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:13:27.661151Z digest=sha256:f487f6746333af67a4e2f60ee509be27417a8a590cc1162931c8cbc0a617a1b2

Observation 38abb5b1-7265-4560-99b6-0bb37bca9d5c · inbound

SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions cites this paper.

SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions Pix2seq: A Language Modeling Framework for Object Detection

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T19:43:44.541549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:43:44.541549Z digest=sha256:9ab7a900d4f2cd405b83dd4f0fd6a40afadaf1ec8fd9e1a96448a4e13bc99b49

Observation ae263cd5-40e8-4095-b55b-521668b566e7 · inbound

Parameterized Diffusion Optimization enabled Autoregressive Ordinal Regression for Diabetic Retinopathy Grading cites this paper.

Parameterized Diffusion Optimization enabled Autoregressive Ordinal Regression for Diabetic Retinopathy Grading Pix2seq: A Language Modeling Framework for Object Detection

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T19:40:15.056216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:40:15.056216Z digest=sha256:2d70e21a83b605b60b41719d8013af3df81d756770b246705f13a9ca22f0638f

Observation e938ce05-d126-40cc-b325-8a904404d84e · inbound

From Provable Correctness to Probabilistic Generation: A Comparative Review of Program Synthesis Paradigms cites this paper.

From Provable Correctness to Probabilistic Generation: A Comparative Review of Program Synthesis Paradigms Pix2seq: A Language Modeling Framework for Object Detection

Reference 2009

Resolution
unresolved
no resolver link, observed 2026-08-06T15:33:28.819122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:33:28.819122Z digest=sha256:5e822505a94ebfef3f9c3775b3fffb25fcf812f7990c352b1505100e74123f6c

Observation 6e42424b-8660-4faa-8e99-a0a2f5d10226 · inbound

DriveQA: Passing the Driving Knowledge Test cites this paper.

DriveQA: Passing the Driving Knowledge Test Pix2seq: A Language Modeling Framework for Object Detection

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T13:58:05.084880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:58:05.084880Z digest=sha256:837b039874454d8d34b6baeff6e53cd80f4ec3ba4c76e514f72fe74bb664028d

Observation ba5068a3-5aaf-420b-90f0-38c5ea1dae20 · inbound

SAM 2++: Tracking Anything at Any Granularity cites this paper.

SAM 2++: Tracking Anything at Any Granularity Pix2seq: A Language Modeling Framework for Object Detection

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-21T19:54:20.148463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-21T19:51:56.047515Z digest=sha256:c6fb1a9ad9ce4ceca8686dad90ace4ac3689eaee42723074b91991b499982e79

Observation 15121c37-d0da-49a1-beba-ad9b4eb35cab · inbound

Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction cites this paper.

Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction Pix2seq: A Language Modeling Framework for Object Detection

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-16T05:20:39.247034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-16T05:19:11.066723Z digest=sha256:4aa1bb58c1d0247d980f5fe6536c9bff8b27b260ff819b720c51050a2a58110c

Observation b24b4937-78e6-4a7f-b973-f6ea9009dc61 · inbound

Moondream Segmentation: From Words to Masks cites this paper.

Moondream Segmentation: From Words to Masks Pix2seq: A Language Modeling Framework for Object Detection

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T20:18:13.726512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-13T20:14:45.629804Z digest=sha256:4ff1596211109851fed97dd63fe44bceb9b778d6c7f5bbfd2392b3622b51b5e5

Observation d457d7e0-47e5-4d30-917a-fbac837d9dfd · inbound

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction cites this paper.

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction Pix2seq: A Language Modeling Framework for Object Detection

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T06:30:58.362347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T17:37:44.436873Z digest=sha256:8509a1555aa0a508bf165e18f6da8a6eb862265237763f46a1816b42bbe7c6de

Observation 8caedca2-b4bf-4222-b853-4cf29b8abe56 · inbound

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding cites this paper.

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding Pix2seq: A Language Modeling Framework for Object Detection

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-06-30T20:55:04.158931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T20:51:56.131205Z digest=sha256:0dc419fffd5b9566949f1f4b34df2b564cfe2ae271780bf0afbe55ad93605f64

Observation 0f3ea96d-766d-4ff2-b6fe-5f803b2ac123 · inbound

Binding Visual Features Point by Point cites this paper.

Binding Visual Features Point by Point Pix2seq: A Language Modeling Framework for Object Detection

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-06-29T23:44:03.328300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T22:56:44.793896Z digest=sha256:f37e0f367154f1604126de85972e6b517a0cf6782c9fc14795cdd1f5dd9ee5ea

Observation 69a5ac09-a4ce-4260-8892-aa5fe563d0e6 · inbound

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding cites this paper.

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding Pix2seq: A Language Modeling Framework for Object Detection

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.904809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T08:13:42.526597Z digest=sha256:5bbf7707302e2aed7bb4c387706bd6c6bf6c3b06f3ff56bedb3ecda7c74f8484

Observation 7acf2eb3-5cee-41dc-bae7-1311d46255e9 · inbound

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs cites this paper.

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs Pix2seq: A Language Modeling Framework for Object Detection

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-02T22:17:26.311197Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T19:01:14.023587Z digest=sha256:4db5f0151dde383a9f7a6b6add6412535717736286de71abcd1a7b040e5ed14e

Observation 1459c1ca-0239-47d2-8ea5-58544990856c · inbound

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments cites this paper.

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments Pix2seq: A Language Modeling Framework for Object Detection

Reference 88

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T16:29:57.511404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-26T00:35:32.041041Z digest=sha256:33b2af9bcd276290cccc3d15c4c5face599534ba671b8a370020ebe98e4d40fd

Observation ce44e7aa-d473-4b4c-950b-afbec0d58511 · inbound

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments cites this paper.

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments Pix2seq: A Language Modeling Framework for Object Detection

Reference 89

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T06:55:29.063968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-01T06:52:18.115419Z digest=sha256:d20b010ad975aba911913d06aa682988c89cf8e3059974ae62b3ca721628ead3

Observation 679ce7b8-e97c-4fbd-999e-cd951a478da2 · inbound

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments cites this paper.

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments Pix2seq: A Language Modeling Framework for Object Detection

Reference 89

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T21:17:23.693746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-02T21:15:38.699918Z digest=sha256:3ac87e6160e357c936892367d2cc2df6cf29efa8acfeab13620a814c502a2f14

Observation 417e40cd-1d1d-48b8-8569-3011bd7c57b8 · inbound

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments cites this paper.

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments Pix2seq: A Language Modeling Framework for Object Detection

Reference 89

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T22:59:02.648707Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-03T22:54:21.356538Z digest=sha256:8688e2610f45c6f1e03243a29387c6831dcd5b56ad8548f5a6d58e72e6fc4d2d

Observation 694233de-d16d-4ad9-bde4-cfad591daac5 · inbound

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction cites this paper.

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction Pix2seq: A Language Modeling Framework for Object Detection

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T15:58:37.580647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-03T15:49:17.217482Z digest=sha256:74ed4e40df1423fc0adca2fe26937cb501bf029a8b94fa77e6f5089c15c9522d

Observation 07a0372d-df47-44a6-ba5e-1cc3835d7c86 · inbound

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement cites this paper.

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement Pix2seq: A Language Modeling Framework for Object Detection

Reference 132

Resolution
unresolved
no resolver link, observed 2026-08-05T10:23:59.183387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T10:23:59.183387Z digest=sha256:1d46fddbc60d2dceeefd01944a054639c202874db5a0b520c9307ff936b3a090