REBASE:背景の影響を消して、学習なしのインコンテキスト分割を改善
REBASE は、1枚の注釈付き参照画像から新しい対象を分割する training-free な手法です。参照画像の背景特徴サブスペースを取り除くことで、背景に引きずられた誤った類似度を抑えます。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 795 件の記事
REBASE は、1枚の注釈付き参照画像から新しい対象を分割する training-free な手法です。参照画像の背景特徴サブスペースを取り除くことで、背景に引きずられた誤った類似度を抑えます。
続きを読むXiaomi-Robotics-1 は、ロボット学習にも大規模データとモデル拡大によるスケーリング効果が成立するかを検証する VLA 基盤モデルだ。10万時間を超える実世界操作軌跡を使い、未知環境での操作や少量データでの適応を狙う。
続きを読むKAIST AI の研究は、VLA モデルにおけるカメラ視点とロボット動作座標系のずれに注目する。Robot-centric pointmaps は、各ピクセルにロボット座標系での 3D 位置を持たせ、既存の 2D VLA に比較的少ない変更で組み込める表現だ。
続きを読むRAGUは、知識抽出とグラフ統合を分離するオープンソースのGraphRAGエンジンだ。専用の7Bモデル Meno-Lite-0.1 により、巨大モデルに頼らない構築を狙う。
続きを読む新しい論文は、セキュリティAIエージェントを評価する際に、最高成功率だけでなくコストを同時に見る必要があると主張する。攻撃側タスクと防御側タスクでは、性能向上の仕方が大きく異なる。
続きを読むNAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。
続きを読むQwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。
続きを読むS1-Omni は、AI for Science における分断されたデータ形式とタスクを一つの推論モデルに統合しようとする取り組みです。200 以上の科学タスクを対象とし、モデル重み、推論コード、データセットの一部も公開されています。
続きを読むこの研究は、Muon を疎報酬のエージェント強化学習に適用し、その効果が優位性推定器と学習率の組み合わせに強く依存することを示している。
続きを読む新しい論文は、交渉中の値を暗号化しても、譲歩の速度や提示額の軌跡、収束パターンから私的制約が推測され得ると指摘する。著者らは、性能を保ちながら推論攻撃を弱める適応的なランダム化方策を提案している。
続きを読むNVIDIA は Hugging Face 上で、ロボットとビジョン AI 向けの 40 億パラメータ級オープン世界モデル Cosmos 3 Edge を公開した。場面理解、未来予測、シミュレーション、行動生成をエッジデバイスで扱うことを狙う。
続きを読むGrabは、自律型AIワークロードを安全に実行するためのPalanaを構築した。Kubernetesの分離、ゼロトラスト、プロキシ認可、監査を組み合わせた基盤だ。
続きを読むxHC は、Hyper-Connections を N=4 の壁の先へ進め、残差ストリーム幅を大規模言語モデルの新しいスケーリング軸として扱う研究です。N=16 の状態を保ちながら一部のストリームだけを更新することで、性能向上と計算コスト抑制の両立を狙います。
続きを読むHugging Face Daily Papers に掲載された論文は、MoE 構成のループ型 Transformer「Loopie」を紹介している。著者らは、同じ事前学習計算量の下で通常の Transformer ベースラインを上回り、後処理学習によって強い推論能力を得たと主張する。
続きを読むCura 1T は、医療を単なるQAではなく、対話・推論・診断・ツール利用が連動する領域として捉える。能力ごとに狙いを定めて改善する訓練ループが特徴だ。
続きを読むAV-Flamingo は、短いクリップではなく、長く複雑な実世界の音声・映像動画を対象にしたオープンな大規模モデルです。大規模データ、段階的学習、時刻に結びついた推論で、長期的な整合性と説明性を高めています。
続きを読むRecursive Harness Self-Improvement(RHI)は、エージェントを動かす外側の足場である harness を、固定された設計ではなく改善対象として扱う。少数の反復で低い推論強度のエージェント性能を高め、推論コストも下げられる可能性を示した。
続きを読むDSWorld は、データサイエンス向け自律エージェントに世界モデルの考え方を導入し、高コストな実行の前に操作結果を予測する。論文では、RL ベースの訓練を約 14 倍、探索ベース推論を約 3〜6 倍高速化したと報告している。
続きを読むKimi はユーザーリクエストの急増により既存の算力クラスタが上限に近づいたとして、C 向け新規ユーザーのサブスクリプションを一時停止した。あわせて算力拡張と、Kimi 本体権益と Kimi Code 権益の分離管理を進める。
続きを読むフランスとイタリアの研究者は、AIの助言があるだけで人が「わからない」と言いにくくなり、正答率が下がると報告した。しかも自信だけは大きく上がっていた。
続きを読む