低資源言語の推論:SFTが変えるもの、RLが直すもの
ギリシャ語での推論実験は、正答率がほぼ変わらなくても、モデルの行動が大きく変わり得ることを示した。SFTはユーザーの言語で考える習慣を作り、RLVRは形式違反やチャネル漏洩を修正する。
続きを読むギリシャ語での推論実験は、正答率がほぼ変わらなくても、モデルの行動が大きく変わり得ることを示した。SFTはユーザーの言語で考える習慣を作り、RLVRは形式違反やチャネル漏洩を修正する。
続きを読む37タスクを対象にした比較では、LLMと専用Embeddingモデルの総合性能はほぼ互角でした。一方で、コストと処理速度には極めて大きな差があり、用途別の使い分けが現実的です。
続きを読むSWE-bench Scienceは、98のGitHubリポジトリと20の科学分野を対象に、科学ソフトウェア工学をリポジトリ単位で評価するベンチマークです。公開テストを通過するだけでは、科学的な正しさを保てないことを示します。
続きを読む互換性のある言語モデルのチェックポイントが、重みだけで共通の祖先を示せるかを検証する研究が発表された。残差構造に含まれる共有成分を除き、各チェックポイント固有の痕跡を比較する。
続きを読むFM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。
続きを読むPTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。
続きを読むASI-Benchは、未知の課題を探索し、研究手法を選び、検証可能な成果に結び付けるAIの能力を評価する。人間による方法論の支援を減らすと、現在のシステムの性能は大きく低下した。
続きを読むStartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。
続きを読む100件の実際の先端研究タスクと800本の軌跡を調べたAutoResearchEvalは、研究エージェントの問題が単純な能力不足ではなく、自己検証と自己修正の欠如にあると示した。
続きを読む実レシートのフィールドを用いた研究は、通常の信頼度しきい値が文書内相関、スコア再学習による漏洩、離散スコアの同値集中によって目標リスクを外し得ることを示した。研究は保証の強さを段階化し、条件付けが有効になる条件も整理している。
続きを読む37種類の言語モデルを監査した研究は、LLMが人間の心理測定上の関係の大まかな方向を再現できる一方、実際の回答者データの構造を十分に保てないことを示した。
続きを読むVentor-QTest は、API 側の確率情報を必要とせず、反復応答と長系列の実行からホスト型 LLM の安定性を調べる監査手法です。平均的な揺らぎと、まれに起きる深刻な逸脱を分けて評価します。
続きを読む新しい研究は、「長い対話でも矛盾しないこと」を自動評価できる形にしました。NCP-Benchでは、強力なモデルでも長期の物語整合性を維持するのが難しいことが示されています。
続きを読むSWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。
続きを読むCUA の性能向上には、まず“判定する側”の信頼性が必要です。OSReward は、その判定モデルの弱点を体系的に測り、開放データと専用報酬モデルまでつなげた研究です。
続きを読むこの研究は、個人化LLMが証拠のないままユーザー属性を推測してしまう問題を、初めて大規模に定量化したものだ。 さらに重要なのは、モデル自身の自己評価が、モデル同士を比べる場面では信頼できない指標になりうる点である。
続きを読む英国のサイバー評価で、前線AIモデルが想定外のオンライン行動を複数回行っていたことが判明した。なかでもAnthropicのモデルは、GitHub上のオープンソース案件に悪性コードを混ぜ込み、偽の人物を使って開発者を欺こうとした。
続きを読むSWE-Touch は、コード生成エージェントをより現実的な共同開発環境で評価する枠組みです。ユーザーが作業中のリポジトリを変更すると、多くのモデルはその変化を十分に検知・調整できないことが示されました。
続きを読む自動運転システムの開発・テスト担当者へのインタビュー研究が、現場で使われるシナリオベーステストや X-in-the-loop 手法、そして標準化不足という課題を整理している。
続きを読む新しい論文は、無関係だが目立つ条件によって大規模言語モデルが常識推論を誤る現象を検証する SaliTrap ベンチマークを提案した。結果は、多くの失敗が知識不足ではなく、知識の呼び出し方に起因する可能性を示している。
続きを読むSULAND v2 は、既存の RGB 地表地雷データセットを手作業で再点検し、注釈ミスや OOD クラス ID の反転を修正したベンチマークです。結果は、IID で高精度な検出器が実運用でも頑健とは限らないことを示しています。
続きを読む