Tag
This paper introduces a graph-grounded harness for vision-language models to improve accuracy in answering topology questions about Piping and Instrumentation Diagrams by recovering evidence graphs from images.
VisAdj is a framework for learning adjacency matrices from node-link images, using an attention-sparse neighbor sampler and a line-graph transformer to model edge dependencies, achieving superior performance over existing methods.