Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
Q^(xq∣P)=xq⊤Γ−1(1M∑i=1Myixi).\widehat{Q}(x_{\mathrm{q}}\mid P)=x_{\mathrm{q}}^{\top}\Gamma^{-1}\left(\frac{1}{M}\sum_{i=1}^{M}y_{i}x_{i}\right). (5) Moreover, in the noiseless realizable case, εQ(M,N)≜ݔ�w∗,xi,xq[(Q^(xq∣P)−⟨w∗,xq⟩)2]≤(d+1)tr(Λ)M+(1+2d+d2κ)tr(Λ)N2,\varepsilon_{Q}(M,N)\tr...